
官方博客:https://spherelab.ai/orbit/
Adapter-first系统架构设计
1. 极致的显存压缩与训推精度绝对对齐
Orbit将精度对齐的问题前置到了系统设计的最底层。训练引擎和推理引擎使用完全相同的低精度Base,并在其上加载同一个BF16高精度Adapter。
这意味着,训练和Rollout走的是同一条低精度Base + 高精度Adapter的路径。
从系统层面被一刀切断的误差,让train-rollout log-prob diff保持了惊人的稳定!
2. 告别GB级的数据搬运
每次训练更新后,系统只需要将MB级别的Adapter从训练引擎推送到推理引擎,而不需要搬运GB级别的庞大Base权重。
这不仅成百上千倍地减少了权重同步的体积,更避免了频繁重建推理引擎所带来的巨大开销,大大提升了系统效率。
三大万亿巨头实测
1. Kimi-K2.6:
Reward持续上升 Eval Accuracy稳步上升 Pass@k显著上升 Train-rollout log-prob diff 始终保持在极度稳定的安全区间 
2. DeepSeek-V4 Flash:
3. 1.6T DeepSeek V4 Pro:


榨干每一滴GPU算力
Active-expert-chunked dequantization:
对于 MoE 模型来说,每个词元只会激活部分 experts。Orbit 动态地将 router 选中的 experts 分组成固定大小的 batch,临时反量化后执行 grouped GEMM,并在计算结束后释放高精度权重。这样既能利用 grouped matrix multiplication 的吞吐,又能将临时显存峰值限制在较小 chunk 内,避免大规模低精度 MoE 训练中的 OOM。
Adapter-native async with double-buffered rollout:
系统会为 adapter 维护版本号,并将新版本 adapter 流式写入 inactive slot;当前 active slot 继续服务 in-flight 请求,待新版本准备好后再原子切换。这样可以减少 rollout bubble。在 Qwen3-4B + OFT、8×B200、TP=2 设置下,该设计带来了 1.42 倍的单步时间优化和 44% 更高的 rollout throughput,同时 eval accuracy 保持不变。
专为DeepSeek V4定制的全栈优化:
Orbit 支持 Full-CUDA graph decoding、DeepGEMM、DeepEP V2,并使用 tilelang / Triton / CUDA 实现高效 attention backward 和 fusion kernels。根据 adapter 训练的特点,Orbit 还设计了 bypass-base-weight-grad 的高效 GEMM backward 算子,避免为冻结 base 计算不必要的梯度。

