HISTORY / 01.2比较工作台

该入口属于“历史”的二级页面;顶部悬浮“历史”可再次进入。

HISTORY / TRAINING TECHNOLOGY2017—2026 / SOURCE BACKED

训练技术横向比较

把 Attention、MoE、残差、激活函数、优化器、量化训练、kernel 与分布式系统放在同一张矩阵中,但不混淆指标口径。每项都能回到论文、官方博客或代码仓,并按 STAR 说明为什么做、如何验证、得到什么结果。

技术
39
子分类
9
直接来源
94
已选 3 / 5
模型结构 · Attention

Full Attention / Transformer

用全局多头自注意力替代循环与卷积,建立可并行训练的 Transformer 基线;代价是序列长度上的二次复杂度。

第一作者Ashish VaswaniGoogle Brain / Google Research论文作者页

核心 Result
28.4 BLEU
适用
中短上下文、追求质量上限和成熟 kernel 支持的训练与推理。
可用性
论文公开;主流框架均有实现。
模型结构 · Attention

Multi-Query Attention (MQA)

让全部 query heads 共享单组 K/V heads,显著缩小自回归解码需要反复读取的 KV cache,以少量质量退化换取更高吞吐。

第一作者Noam ShazeerGoogle论文作者页

核心 Result
1 KV head
适用
内存带宽受限的自回归服务,尤其是长上下文或大 batch 解码。
可用性
论文公开;主流推理框架与多种现代 LLM 架构支持。
模型结构 · MoE

Switch Transformer / 辅助损失均衡

以 top-1 token-choice router 和辅助负载均衡损失简化稀疏 MoE,让参数容量增长而单 token 计算近似不变。

第一作者William FedusGoogle Research论文作者页

核心 Result
up to 7×
适用
需要以稀疏激活扩大参数容量、且可接受 all-to-all 通信的预训练。
可用性
论文与 JMLR 版本公开;Transformers 等框架有实现。
模型结构 · MoE

Expert Choice Routing

把“token 选专家”反转为“专家选 token”,用固定 bucket 从结构上保证每个专家负载一致。

第一作者Yanqi ZhouGoogle Research个人主页

核心 Result
>2× 收敛
适用
需要严格专家负载可预测、愿意接受每 token 计算不均的 MoE 训练。
可用性
论文与 Google Research 说明公开。
模型结构 · Attention

Grouped-Query Attention (GQA)

以多于 1、少于 query heads 的 KV heads 折中 MHA 质量与 MQA 速度,并可用少量继续训练把既有 MHA checkpoint 转成 GQA。

第一作者Joshua AinslieGoogle Research论文作者页

核心 Result
5% uptraining compute
适用
希望控制 KV cache 体积、同时降低 MQA 质量风险的通用 LLM 训练与服务。
可用性
论文公开;Transformers、vLLM、SGLang 等广泛支持。
模型结构 · Attention

PagedAttention / vLLM

借鉴操作系统分页管理 KV cache,消除连续预留造成的碎片,是推理内存管理创新而非训练 attention 结构。

第一作者Woosuk KwonUC Berkeley个人主页

核心 Result
2–4× 吞吐
适用
在线自回归 LLM 推理、连续批处理、beam / parallel sampling。
可用性
论文公开;vLLM 开源并广泛部署。
模型结构 · Attention

Multi-Head Latent Attention (MLA)

用低秩下投影把各 head 的 K/V 联合压缩为共享 latent cache,并在计算时上投影恢复,兼顾多头表达与小 KV cache。

主责团队DeepSeek-AIDeepSeek-AI官方项目

核心 Result
KV cache −93.3%*
适用
大模型、长上下文与高并发解码,尤其希望比 MQA/GQA 保留更多多头自由度时。
可用性
DeepSeek-V2/V3 技术报告、模型权重和 FlashMLA 实现公开。
模型结构 · MoE

Auxiliary-Loss-Free MoE Balancing

在路由分数上动态加入专家偏置,用反馈控制均衡负载,不再让均衡目标的梯度干扰语言建模目标。

第一作者Lean WangPeking University / DeepSeek-AI个人主页

核心 Result
3B / 200B tokens
适用
大规模 token-choice MoE,尤其关注主任务质量与负载控制解耦的训练。
可用性
论文公开;已在 DeepSeek-V3 技术报告中用于大规模训练。
模型结构 · Attention

Gated DeltaNet (GDN)

把门控遗忘与 delta rule 精确更新结合,在固定大小状态上改善线性 attention 的检索与长上下文能力。

第一作者Songlin YangNVIDIA Research个人主页

核心 Result
ICLR 2025
适用
长上下文、流式解码,以及需要线性序列复杂度的 hybrid 架构。
可用性
论文与 NVIDIA 官方 PyTorch 实现已公开。
模型结构 · 优化器

Muon Optimizer at Scale

对二维权重更新做矩阵正交化,并用 weight decay 与参数尺度校准把 Muon 从小模型扩展到大规模 LLM。

第一作者Jingyuan LiuMoonshot AI论文作者页

核心 Result
~2× compute efficiency
适用
预训练中的矩阵权重;愿意承担额外正交化与分布式通信实现复杂度的团队。
可用性
论文、分布式实现与 Moonlight checkpoints 公开。
模型结构 · Attention

DeepSeek Sparse Attention (DSA)

用轻量 Lightning Indexer 为历史 token 打分,再让主注意力只访问 top-k KV entries,将主 attention 从全量覆盖改成细粒度稀疏选择。

主责团队DeepSeek-AIDeepSeek-AI官方项目

核心 Result
Main attention O(Lk)
适用
需要精细全局检索而无法只依赖固定滑窗的超长上下文模型。
可用性
DeepSeek-V3.2-Exp 权重、报告、参考推理、indexer 与 sparse kernels 已公开。
模型结构 · Attention

Kimi Delta Attention (KDA)

把 GDN 的 head-wise scalar forget gate细化为逐 channel 对角 decay,提高有限 recurrent state 的表达力,并用专用 chunkwise 算法实现高效训练。

第一作者Yu ZhangMoonshot AI论文作者页

核心 Result
up to 6× decode*
适用
超长上下文、流式生成和希望以周期性全局 attention 补足固定状态容量的 hybrid 架构。
可用性
论文、Kimi Linear 权重、官方仓库、KDA kernel 与 vLLM 支持公开。
模型结构 · MoE

LatentMoE

只把 routed experts 的 payload 投影到更窄 latent 维度,router 与 shared experts 保持原 hidden 维度;把通信和权重带宽节省重新投入更多、更细专家。

第一作者Venmugil ElangoNVIDIA论文作者页

核心 Result
d/l up to 4× in Nemotron 3
适用
MoE expert dispatch/权重带宽是瓶颈、又希望增加专家粒度和路由多样性的大模型。
可用性
论文、NVIDIA 研究页、Nemotron 3 Super 配置与 modeling_nemotron_h.py 实现公开。
模型结构 · 残差连接

Attention Residuals (AttnRes)

用沿网络深度的 input-dependent softmax attention 替代固定单位权重残差累加,使每层选择性检索更早表示;Block 版本把开销压到少量块级状态。

第一作者Guangyu ChenMoonshot AI论文作者页

核心 Result
GPQA +7.5 / HumanEval +3.1*
适用
深层 PreNorm Transformer,以及希望改善跨深度表示/梯度分布的超大模型。
可用性
论文、官方仓库与伪代码公开;Kimi K3 官方确认采用。
模型结构 · Attention

DeepSeek-V4 CSA/HCA + Indexer Compressor

把学习型 token compressor 与 DSA 组合成 CSA,并与重压缩但 dense 的 HCA 交错;Indexer Compressor 是 CSA 内部子组件,不是独立注意力家族。

主责团队DeepSeek-AIDeepSeek-AI官方项目

核心 Result
1M:27% FLOPs / 10% KV*
适用
百万 token 长上下文、需要同时控制主 attention、indexer 扫描和 KV cache 的超大模型。
可用性
V4 权重、技术报告与 reference inference/model.py 公开;生产级 kernel 支持依后端。
模型结构 · MoE

Stable LatentMoE (Kimi K3)

Kimi K3 公布的 LatentMoE 变体,896 个 experts 每 token 路由 16 个,另含 2 个 shared experts、3,584 latent MoE dimension 与 3,072 per-expert hidden dimension;单项消融未披露。

主责团队Moonshot AI Kimi 团队Moonshot AI模型卡

核心 Result
16 / 896 experts
适用
3T 级超稀疏 MoE;当前可复核的是 Kimi K3 架构采用,不等于已给出可移植单项训练 recipe。
可用性
Kimi K3 权重、模型卡、config、许可证和技术报告已于 2026-07-27 公开;生产 kernel 支持仍依 SGLang/vLLM 等后端。
模型结构 · 激活函数

Sigmoid Tanh Unit (SiTU)

Kimi K3 官方 config 与 modeling_kimi_linear.py 确认 SiTU-GLU:对 gate 做 β·tanh(gate/β)·sigmoid(gate),并可对 up 做 linear_β·tanh(up/linear_β),K3 取 β=4.0、linear_β=25.0。

主责团队Moonshot AI Kimi 团队Moonshot AI官方实现

核心 Result
β=4.0 / linear_β=25.0
适用
当前可作为 Kimi K3 activation 结构的官方实现记录;迁移到其他 MoE 前仍需单项 ablation 或复现实验。
可用性
Kimi K3 权重、config 与 modeling_kimi_linear.py 已公开;Transformers 需 trust_remote_code 加载官方自定义实现。
算法流程 · 量化训练

Quantization-Aware Training (QAT)

训练时以 fake quant 显式模拟目标推理量化,让模型适应舍入、裁剪和尺度误差;训练后再转换为真实低比特部署图。

第一作者Benoit JacobGoogle论文作者页

核心 Result
Llama3-8B:最高恢复 96% PTQ 精度损失*
适用
PTQ 质量不够、部署位宽与 kernel 已确定的 INT8、INT4、W4A8/W4A4、FP4 或 KV-cache 量化。
可用性
TensorFlow Model Optimization 提供 Keras/TFLite INT8 QAT;TorchAO 已覆盖 INT4、INT8+INT4、FP8+INT4 与实验性 NVFP4,LLM-QAT、EfficientQAT 有公开代码。
算法流程 · 训练算法

GRPO

用同题多次采样的组内相对奖励替代 PPO 的独立 critic,降低推理强化学习的显存与系统复杂度。

第一作者Zhihong ShaoDeepSeek-AI个人主页

核心 Result
MATH 51.7%
适用
有可验证终局奖励的数学、代码、工具使用等 reasoning 后训练。
可用性
论文公开;多个开源 RL 框架已实现。
算法流程 · 训练算法

DanceGRPO

把 GRPO 扩展到 diffusion 与 rectified flow 的图像/视频生成,在多任务、多奖励模型上统一视觉 RL。

第一作者Zeyue XueByteDance Seed / The University of Hong KongGitHub

核心 Result
up to +181%
适用
需要用审美、对齐、运动或二值偏好奖励优化图像/视频生成模型。
可用性
论文与项目页公开。
算法流程 · 训练算法

DiffusionNFT

不在反向采样轨迹上估 likelihood,而是在 forward process 上对比正负样本,把黑盒奖励转成 flow-matching 微调方向。

第一作者Kaiwen ZhengTsinghua University / NVIDIA个人主页

核心 Result
up to 25×
适用
使用 flow matching/diffusion、黑盒 sampler 与多 reward model 的图像生成对齐。
可用性
ICLR 2026 Oral 论文公开;代码可用性以论文项目更新为准。
算法流程 · 训练算法

On-Policy Distillation (OPD)

让 student 生成自己的轨迹,再由 teacher 为每个 token 提供 dense reverse-KL 信号,结合 RL 的 on-policy relevance 与蒸馏的稠密监督。

第一作者Kevin LuThinking Machines Lab个人主页

核心 Result
9–30× CE
适用
已有强 teacher、student 已具备目标行为 support 的 reasoning、个性化与持续学习。
可用性
官方博客、伪代码与 Tinker 可复现实验 recipe 已公开。
算法流程 · 训练算法

Categorical Flow Maps (CFM)

把连续 flow matching 扩到离散语言建模:1.7B base flow model 在 2.1T tokens 上训练,再自蒸馏成可用少至 4 步生成文本的 CFM。

第一作者Oscar DavisUniversity of Oxford / Apple论文作者页

核心 Result
1.7B / 2.1T / 4 steps
适用
研究非自回归/少步语言生成、需要连续模态 flow matching 优势迁移到离散 token 的团队。
可用性
Apple 研究页和 arXiv 论文公开;截至本轮未发现官方代码、权重或可复现实验配置。
算法流程 · 训练算法

Tunix Agentic RL

把多轮工具调用 Agent 后训练从同步 rollout 改成高并发异步采样与生产者-消费者流水,降低 TPU 因环境 I/O、工具执行和长尾 trajectory 等待造成的空转。

主责团队Google Tunix 团队Google官方项目

核心 Result
async rollout / TPU throughput
适用
使用可验证或环境反馈奖励训练多轮工具 Agent,且基础训练/推理栈偏 JAX、TPU、MaxText、vLLM-TPU 或 SGLang-JAX 的团队。
可用性
Apache-2.0 开源。google/tunix 仓库、ReadTheDocs 文档和 agentic RL 代码可匿名访问;官方 README 标记 V2 release,Agentic RL Training 在 2025/12 已释放,本轮 2026-07-21 官方博客做系统性发布说明。
算法流程 · 训练算法

AgentENV

以 Firecracker microVM、OverlayBD、增量快照/分叉和 E2B-compatible API,把 Agentic RL 的大量有状态执行环境做成可暂停、可恢复、可横向扩展的训练基础设施。

主责团队MADSys Lab / Moonshot AI AgentENV 团队Tsinghua MADSys Lab / Moonshot AI官方项目

核心 Result
30k env / −88.6–96.8%
适用
大规模代码、工具使用、浏览器/软件操作等 Agentic RL rollout,尤其环境长时间等待模型输出、状态需要 fork/resume、且需要比容器更强隔离的场景。
可用性
MIT 开源;GitHub 仓库、文档、Quick Start、Docker/self-host 路径与 E2B-compatible API 说明已公开。服务器侧要求 Linux kernel 6.8+ 与 /dev/kvm;安装脚本目标 Ubuntu 24.04。
算法流程 · 训练算法

SpecForge v0.3

把 target-model feature capture 与 draft-model training 解耦成在线/离线/分离式统一 pipeline,并发布 SpecBundle draft models,覆盖 EAGLE3、DFlash、Domino、DSpark 等多类 speculative decoding 方法。

主责团队SpecForge TeamLMSYS / SGLang官方博客

核心 Result
1.10× train / up to 4.60× serve*
适用
已有强 target model、需要为真实服务模型训练 draft、并希望把 capture capacity 和 trainer capacity 分离调度的推理团队。
可用性
SpecForge 开源,v0.3 博客、sgl-project/SpecForge 仓库、SGLang capture patch、training/serving gate 与 Hugging Face SpecBundle collection 可公开访问。
高效算子 · 高效算子

Triton

以 block/tile 为编程抽象,让开发者用 Python 风格 DSL 写自定义 GPU kernel,由编译器负责共享内存、合并访存与调度。

第一作者Philippe TilletOpenAIGitHub

核心 Result
MAPL 2019
适用
融合算子、研究型新算子、PyTorch 自定义 kernel 与多后端编译实验。
可用性
Apache-2.0 开源,NVIDIA/AMD 生态成熟。
高效算子 · 高效算子

Ascend C

面向 Ascend AI Core 的 C/C++ 风格算子语言,以多级 API、自动并行与孪生调试降低手写 NPU 算子门槛。

主责团队Huawei Ascend C 团队Huawei官方项目

核心 Result
2 人月 → 2 人周
适用
Ascend NPU 上需要硬件级控制的训练/推理自定义算子。
可用性
CANN 文档、样例与 Ascend C 开发工具可用。
高效算子 · 高效算子

Liger Kernel

把 RMSNorm、RoPE、SwiGLU、cross entropy 等 LLM 训练热点写成可直接替换的 Triton fusion/chunking kernel。

第一作者Pin-Lun HsuLinkedInGitHub

核心 Result
+20% / −60%
适用
Hugging Face 兼容 LLM 预训练、SFT、DPO/ORPO/CPO 等后训练。
可用性
Apache-2.0 开源,PyPI 可安装,API 与 benchmark 公开。
高效算子 · 高效算子

Triton-Ascend

把 Triton 核心语法与编译流程适配 Ascend NPU,并以独立算子库沉淀 NPU 特有的访存与调优模式。

主责团队Triton-Ascend 维护团队Huawei Ascend / Triton 社区官方项目

核心 Result
A2 / A3
适用
已有 Triton kernel 资产、希望迁移到 Ascend NPU 的算子团队。
可用性
Ascend 与 triton-lang 组织均有开源仓;调优算子库公开。
高效算子 · 高效算子

LLM MegaKernel

把完整 Llama 前向过程融合进一个持久化 GPU kernel,消除跨层 kernel launch、同步与中间物化。

第一作者Benjamin SpectorStanford Hazy Research论文作者页

核心 Result
>1.5×
适用
固定模型/shape、batch 小、对单请求延迟极敏感的推理。
可用性
研究博客与 HazyResearch/Megakernels 代码仓公开。
高效算子 · 高效算子

HPC-Ops × SGLang

把腾讯混元 HPC-Ops 的 Dynamic Attention、precision-aware Router GEMM 与 Fused MoE 接入 SGLang 主线,在 H20/H200 上给出 MoE 服务端到端与算子级验证。

主责团队Tencent Hunyuan AI Infra and the SGLang TeamTencent Hunyuan / SGLang官方项目

核心 Result
TPOT −15.1–48.8%
适用
NVIDIA Hopper SM90 上的 MoE 推理,尤其是 Hy3、Qwen3、LongCat 等 mixed-length、router-sensitive、small-expert-GEMM 工作负载。
可用性
HPC-Ops 代码仓公开;LMSYS 文章给出 SGLang main branch 集成、PR 链接、安装方式和启动参数。HPC-Ops README 要求 NVIDIA SM90、CUDA 12.8+。
并行方案 · 并行系统

Megatron-LM / Tensor Parallel

在 Transformer 层内按矩阵列/行切分权重,用少量 collective 组合计算,奠定大模型 tensor parallel 基线。

第一作者Mohammad ShoeybiNVIDIA论文作者页

核心 Result
76% scaling
适用
模型层本身无法装入单卡、节点内高速互联充足的大模型预训练。
可用性
论文与 NVIDIA/Megatron-LM 持续维护仓库公开。
并行方案 · 并行系统

DeepSpeed ZeRO

按阶段切分 optimizer state、gradient 和 parameter,消除数据并行中的状态复制,同时保留每层的大粒度计算。

第一作者Samyam RajbhandariMicrosoft ResearchGitHub

核心 Result
15 PFLOPS
适用
希望以数据并行接口训练超出单卡显存的大模型;可叠加 TP/PP。
可用性
ZeRO 论文与 DeepSpeed 开源仓库可用。
并行方案 · 并行系统

PyTorch FSDP1

把 ZeRO-3 式完整状态分片原生集成进 PyTorch,以 nested wrapping、FlatParameter 和通信/计算重叠降低迁移门槛。

第一作者Yanli ZhaoMeta AIGitHub

核心 Result
1T dense demo
适用
PyTorch 原生大模型训练,尤其模型状态超单卡容量但计算仍按数据并行执行。
可用性
PyTorch 原生稳定 API;官方已建议新项目考虑 FSDP2。
并行方案 · 并行系统

PyTorch FSDP2

用 DTensor 的逐参数 dim-0 分片重写 FSDP,保留参数名与结构,改善可组合性、冻结参数、checkpoint 与显存可预测性。

主责团队PyTorch Distributed 团队Meta / PyTorch官方项目

核心 Result
PyTorch 2.4 Prototype
适用
需要 PyTorch 原生 composable distributed、FP8/tensor subclass、2D/3D 并行的新训练项目。
可用性
PyTorch 原生 fully_shard API 与迁移指南公开。
并行方案 · 并行系统

DeepEP / Expert Parallel Communication

面向 MoE dispatch/combine 的高吞吐与低延迟 GPU 通信库,联合 NVLink、RDMA、FP8 与计算通信重叠。

主责团队DeepSeek-AI 开源基础设施团队DeepSeek-AI官方项目

核心 Result
up to 740 GB/s
适用
Hopper/Blackwell 集群上的大规模 sparse MoE 训练与推理。
可用性
MIT 开源;V2 依赖较新的 PyTorch/NCCL/CUDA 与 NVLink/RDMA。
并行方案 · 并行系统

UltraEP

在 MoE 每层、每个 microbatch 的 post-gating 精确负载上实时复制热点专家并重路由 token,把大 EP 训练与 serving prefill 的 rank-level imbalance 压到接近 force-balanced ceiling。

主责团队Dots-Infra / 小红书技术 / 北京大学团队Dots-Infra / Xiaohongshu / Peking University官方项目

核心 Result
94.3% ideal / 1.49×
适用
EP64/EP40 这类 rank 持有专家较少、负载偏斜明显的超大 MoE 训练和 prefill;尤其是 Qwen3-235B、DeepSeek-V3 等稀疏模型级别的 rack-scale 部署。
可用性
MIT 开源;UltraEP v1.0.0 于 2026-07-15 发布,Megatron-LM reference integration 公开,SGLang inference integration 仍标为 experimental / 待生产就绪。
并行方案 · 并行系统

veScale-FSDP

以 RaggedShard 和结构感知 planner 让 FSDP 尊重 block quantization、Muon/Shampoo 等非逐元素结构,同时优化万卡通信与显存。

第一作者Zezhou WangByteDance Seed论文作者页

核心 Result
+5–66% / −16–30%
适用
block-wise quantized training、Muon/Shampoo 与超大规模集群训练。
可用性
论文公开;现有 volcengine/veScale 仓库不等同论文所述 FSDP 实现。
02 / SIDE-BY-SIDE

同一证据口径,逐维比较技术

Result 保留原论文实验口径;“最高提升”不跨硬件、模型与任务外推。

比较维度并行方案PyTorch FSDP11T dense demo并行方案PyTorch FSDP2PyTorch 2.4 Prototype并行方案veScale-FSDP+5–66% / −16–30%
分类 / 发布并行方案 · 并行系统2022-03-14 · PyTorch / Meta并行方案 · 并行系统2024-07-24 · PyTorch / Meta并行方案 · 并行系统2026-02-25 · ByteDance
一作 / 主责团队Yanli ZhaoMeta AIGitHubPyTorch Distributed 团队Meta / PyTorch官方项目Zezhou WangByteDance Seed论文作者页
核心机制FlatParameter group + nested FSDP wrapping + all-gather/reduce-scatter。per-parameter DTensor sharding + module-scoped communication groups。flexible RaggedShard data placement + structure-aware sharding/communication planner。
Token mixing不适用 / 未单列不适用 / 未单列不适用 / 未单列
KV / state layout不适用 / 未单列不适用 / 未单列不适用 / 未单列
Selector / compressor无 / 未单列无 / 未单列无 / 未单列
S · SituationZeRO/FairScale 证明全分片有效,但 PyTorch 用户需要更原生、与 allocator/dispatcher 协同的工业实现。FSDP1 的 FlatParameter 破坏原参数边界,使 tensor subclass、FP8、冻结参数、checkpoint 和多维并行组合困难。FSDP1/2 的固定逐元素或逐行分片与 block-wise 低精度、Muon/Shampoo 的矩阵结构冲突,在万卡规模也有通信/显存瓶颈。
T · Target用接近本地模型的编程体验训练远超单卡容量的模型,并维持接近 DDP 的吞吐。在维持相近吞吐的前提下,用逐参数分片获得更直观、可组合的表示。在兼容结构化训练方法的同时,超过现有 FSDP 的吞吐和显存效率并扩至数万 GPU。
A · Action / 实验按 module 把参数 flatten 后分片,前/反向按需 all-gather,完成后 reshard/free,并与 CUDA allocator、prefetch 和 CPU offload 联合设计。fully_shard 把参数原位转为 Shard(0) DTensor;module hooks 调度 all-gather/free/reduce-scatter,并重新设计多 stream 显存管理和显式 prefetch。设计允许不等长、保留结构边界的 RaggedShard,以及 structure-aware planning;在多模型、优化器、量化与大规模集群上对比现有 FSDP。
R · ResultAWS scaling test 可训练 1T dense 模型;报告 GPT-1T 每 A100 84 TFLOPS、GPT-175B 每 A100 159 TFLOPS。论文显示接近 DDP 且 TFLOPS 近线性扩展。官方文档定位为相对 FSDP1 保持相近 throughput;FSDP2 解除冻结参数约束、支持 communication-free sharded state dict,并带来确定性更强的显存行为。论文报告比现有 FSDP 系统高 5–66% 吞吐、低 16–30% 显存,并可扩展到数万 GPU。
适用场景PyTorch 原生大模型训练,尤其模型状态超单卡容量但计算仍按数据并行执行。需要 PyTorch 原生 composable distributed、FP8/tensor subclass、2D/3D 并行的新训练项目。block-wise quantized training、Muon/Shampoo 与超大规模集群训练。
计算 / 显存参数、梯度、optimizer state 全分片;临时 unsharded 参数峰值取决于 wrap 粒度/prefetch。全状态分片;避免 FSDP1 record_stream 模式,显存更可预测。报告 +5–66% throughput、−16–30% memory;收益来自布局、通信和峰值控制共同作用。
并行维度Fully Sharded Data Parallel,可与 TP 等组合但 FlatParameter 降低可组合性。FSDP + DTensor DeviceMesh,便于组合 TP/PP/CP。Fully Sharded Data Parallel,目标规模到 tens of thousands GPUs。
局限 / 边界flatten 后参数边界、冻结参数、state_dict 与其他 parallelism 组合复杂;内存调度较难预测。无自动 bucketing,通信 grouping 由 module 结构决定;API 与 FSDP1 不兼容且需要迁移。截至 2026-07-19,论文结果可核验,但对应 veScale-FSDP 实现尚不能视为已公开可用;需等待代码与独立复现。
代码 / 可用性PyTorch 原生稳定 API;官方已建议新项目考虑 FSDP2。PyTorch 原生 fully_shard API 与迁移指南公开。论文公开;现有 volcengine/veScale 仓库不等同论文所述 FSDP 实现。
实证官方博客 · Introducing PyTorch Fully Sharded Data Parallel API论文 · PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel官方博客 · PyTorch 2.4 Release Blog代码仓 · torch.distributed.fsdp.fully_shard论文 · veScale-FSDP: Flexible and High-Performance FSDP at Scale