Full Attention / Transformer
用全局多头自注意力替代循环与卷积,建立可并行训练的 Transformer 基线;代价是序列长度上的二次复杂度。
第一作者Ashish VaswaniGoogle Brain / Google Research论文作者页 ↗
- 核心 Result
- 28.4 BLEU
- 适用
- 中短上下文、追求质量上限和成熟 kernel 支持的训练与推理。
- 可用性
- 论文公开;主流框架均有实现。
该入口属于“历史”的二级页面;顶部悬浮“历史”可再次进入。
HISTORY / TRAINING TECHNOLOGY2017—2026 / SOURCE BACKED
把 Attention、MoE、残差、激活函数、优化器、量化训练、kernel 与分布式系统放在同一张矩阵中,但不混淆指标口径。每项都能回到论文、官方博客或代码仓,并按 STAR 说明为什么做、如何验证、得到什么结果。
用全局多头自注意力替代循环与卷积,建立可并行训练的 Transformer 基线;代价是序列长度上的二次复杂度。
第一作者Ashish VaswaniGoogle Brain / Google Research论文作者页 ↗
让全部 query heads 共享单组 K/V heads,显著缩小自回归解码需要反复读取的 KV cache,以少量质量退化换取更高吞吐。
第一作者Noam ShazeerGoogle论文作者页 ↗
以 top-1 token-choice router 和辅助负载均衡损失简化稀疏 MoE,让参数容量增长而单 token 计算近似不变。
第一作者William FedusGoogle Research论文作者页 ↗
把“token 选专家”反转为“专家选 token”,用固定 bucket 从结构上保证每个专家负载一致。
第一作者Yanqi ZhouGoogle Research个人主页 ↗
以多于 1、少于 query heads 的 KV heads 折中 MHA 质量与 MQA 速度,并可用少量继续训练把既有 MHA checkpoint 转成 GQA。
第一作者Joshua AinslieGoogle Research论文作者页 ↗
借鉴操作系统分页管理 KV cache,消除连续预留造成的碎片,是推理内存管理创新而非训练 attention 结构。
第一作者Woosuk KwonUC Berkeley个人主页 ↗
用低秩下投影把各 head 的 K/V 联合压缩为共享 latent cache,并在计算时上投影恢复,兼顾多头表达与小 KV cache。
主责团队DeepSeek-AIDeepSeek-AI官方项目 ↗
在路由分数上动态加入专家偏置,用反馈控制均衡负载,不再让均衡目标的梯度干扰语言建模目标。
第一作者Lean WangPeking University / DeepSeek-AI个人主页 ↗
把门控遗忘与 delta rule 精确更新结合,在固定大小状态上改善线性 attention 的检索与长上下文能力。
第一作者Songlin YangNVIDIA Research个人主页 ↗
对二维权重更新做矩阵正交化,并用 weight decay 与参数尺度校准把 Muon 从小模型扩展到大规模 LLM。
第一作者Jingyuan LiuMoonshot AI论文作者页 ↗
用轻量 Lightning Indexer 为历史 token 打分,再让主注意力只访问 top-k KV entries,将主 attention 从全量覆盖改成细粒度稀疏选择。
主责团队DeepSeek-AIDeepSeek-AI官方项目 ↗
把 GDN 的 head-wise scalar forget gate细化为逐 channel 对角 decay,提高有限 recurrent state 的表达力,并用专用 chunkwise 算法实现高效训练。
第一作者Yu ZhangMoonshot AI论文作者页 ↗
只把 routed experts 的 payload 投影到更窄 latent 维度,router 与 shared experts 保持原 hidden 维度;把通信和权重带宽节省重新投入更多、更细专家。
第一作者Venmugil ElangoNVIDIA论文作者页 ↗
用沿网络深度的 input-dependent softmax attention 替代固定单位权重残差累加,使每层选择性检索更早表示;Block 版本把开销压到少量块级状态。
第一作者Guangyu ChenMoonshot AI论文作者页 ↗
把学习型 token compressor 与 DSA 组合成 CSA,并与重压缩但 dense 的 HCA 交错;Indexer Compressor 是 CSA 内部子组件,不是独立注意力家族。
主责团队DeepSeek-AIDeepSeek-AI官方项目 ↗
Kimi K3 公布的 LatentMoE 变体,896 个 experts 每 token 路由 16 个,另含 2 个 shared experts、3,584 latent MoE dimension 与 3,072 per-expert hidden dimension;单项消融未披露。
主责团队Moonshot AI Kimi 团队Moonshot AI模型卡 ↗
Kimi K3 官方 config 与 modeling_kimi_linear.py 确认 SiTU-GLU:对 gate 做 β·tanh(gate/β)·sigmoid(gate),并可对 up 做 linear_β·tanh(up/linear_β),K3 取 β=4.0、linear_β=25.0。
主责团队Moonshot AI Kimi 团队Moonshot AI官方实现 ↗
训练时以 fake quant 显式模拟目标推理量化,让模型适应舍入、裁剪和尺度误差;训练后再转换为真实低比特部署图。
第一作者Benoit JacobGoogle论文作者页 ↗
用同题多次采样的组内相对奖励替代 PPO 的独立 critic,降低推理强化学习的显存与系统复杂度。
第一作者Zhihong ShaoDeepSeek-AI个人主页 ↗
把 GRPO 扩展到 diffusion 与 rectified flow 的图像/视频生成,在多任务、多奖励模型上统一视觉 RL。
第一作者Zeyue XueByteDance Seed / The University of Hong KongGitHub ↗
不在反向采样轨迹上估 likelihood,而是在 forward process 上对比正负样本,把黑盒奖励转成 flow-matching 微调方向。
第一作者Kaiwen ZhengTsinghua University / NVIDIA个人主页 ↗
让 student 生成自己的轨迹,再由 teacher 为每个 token 提供 dense reverse-KL 信号,结合 RL 的 on-policy relevance 与蒸馏的稠密监督。
第一作者Kevin LuThinking Machines Lab个人主页 ↗
把连续 flow matching 扩到离散语言建模:1.7B base flow model 在 2.1T tokens 上训练,再自蒸馏成可用少至 4 步生成文本的 CFM。
第一作者Oscar DavisUniversity of Oxford / Apple论文作者页 ↗
把多轮工具调用 Agent 后训练从同步 rollout 改成高并发异步采样与生产者-消费者流水,降低 TPU 因环境 I/O、工具执行和长尾 trajectory 等待造成的空转。
主责团队Google Tunix 团队Google官方项目 ↗
以 Firecracker microVM、OverlayBD、增量快照/分叉和 E2B-compatible API,把 Agentic RL 的大量有状态执行环境做成可暂停、可恢复、可横向扩展的训练基础设施。
主责团队MADSys Lab / Moonshot AI AgentENV 团队Tsinghua MADSys Lab / Moonshot AI官方项目 ↗
把 target-model feature capture 与 draft-model training 解耦成在线/离线/分离式统一 pipeline,并发布 SpecBundle draft models,覆盖 EAGLE3、DFlash、Domino、DSpark 等多类 speculative decoding 方法。
主责团队SpecForge TeamLMSYS / SGLang官方博客 ↗
以 block/tile 为编程抽象,让开发者用 Python 风格 DSL 写自定义 GPU kernel,由编译器负责共享内存、合并访存与调度。
第一作者Philippe TilletOpenAIGitHub ↗
面向 Ascend AI Core 的 C/C++ 风格算子语言,以多级 API、自动并行与孪生调试降低手写 NPU 算子门槛。
主责团队Huawei Ascend C 团队Huawei官方项目 ↗
把 RMSNorm、RoPE、SwiGLU、cross entropy 等 LLM 训练热点写成可直接替换的 Triton fusion/chunking kernel。
第一作者Pin-Lun HsuLinkedInGitHub ↗
把 Triton 核心语法与编译流程适配 Ascend NPU,并以独立算子库沉淀 NPU 特有的访存与调优模式。
主责团队Triton-Ascend 维护团队Huawei Ascend / Triton 社区官方项目 ↗
把完整 Llama 前向过程融合进一个持久化 GPU kernel,消除跨层 kernel launch、同步与中间物化。
第一作者Benjamin SpectorStanford Hazy Research论文作者页 ↗
把腾讯混元 HPC-Ops 的 Dynamic Attention、precision-aware Router GEMM 与 Fused MoE 接入 SGLang 主线,在 H20/H200 上给出 MoE 服务端到端与算子级验证。
主责团队Tencent Hunyuan AI Infra and the SGLang TeamTencent Hunyuan / SGLang官方项目 ↗
在 Transformer 层内按矩阵列/行切分权重,用少量 collective 组合计算,奠定大模型 tensor parallel 基线。
第一作者Mohammad ShoeybiNVIDIA论文作者页 ↗
按阶段切分 optimizer state、gradient 和 parameter,消除数据并行中的状态复制,同时保留每层的大粒度计算。
第一作者Samyam RajbhandariMicrosoft ResearchGitHub ↗
把 ZeRO-3 式完整状态分片原生集成进 PyTorch,以 nested wrapping、FlatParameter 和通信/计算重叠降低迁移门槛。
第一作者Yanli ZhaoMeta AIGitHub ↗
用 DTensor 的逐参数 dim-0 分片重写 FSDP,保留参数名与结构,改善可组合性、冻结参数、checkpoint 与显存可预测性。
主责团队PyTorch Distributed 团队Meta / PyTorch官方项目 ↗
面向 MoE dispatch/combine 的高吞吐与低延迟 GPU 通信库,联合 NVLink、RDMA、FP8 与计算通信重叠。
主责团队DeepSeek-AI 开源基础设施团队DeepSeek-AI官方项目 ↗
在 MoE 每层、每个 microbatch 的 post-gating 精确负载上实时复制热点专家并重路由 token,把大 EP 训练与 serving prefill 的 rank-level imbalance 压到接近 force-balanced ceiling。
主责团队Dots-Infra / 小红书技术 / 北京大学团队Dots-Infra / Xiaohongshu / Peking University官方项目 ↗
以 RaggedShard 和结构感知 planner 让 FSDP 尊重 block quantization、Muon/Shampoo 等非逐元素结构,同时优化万卡通信与显存。
第一作者Zezhou WangByteDance Seed论文作者页 ↗
Result 保留原论文实验口径;“最高提升”不跨硬件、模型与任务外推。
| 比较维度 | 并行方案PyTorch FSDP11T dense demo | 并行方案PyTorch FSDP2PyTorch 2.4 Prototype | 并行方案veScale-FSDP+5–66% / −16–30% |
|---|---|---|---|
| 分类 / 发布 | 并行方案 · 并行系统2022-03-14 · PyTorch / Meta | 并行方案 · 并行系统2024-07-24 · PyTorch / Meta | 并行方案 · 并行系统2026-02-25 · ByteDance |
| 一作 / 主责团队 | Yanli ZhaoMeta AIGitHub ↗ | PyTorch Distributed 团队Meta / PyTorch官方项目 ↗ | Zezhou WangByteDance Seed论文作者页 ↗ |
| 核心机制 | FlatParameter group + nested FSDP wrapping + all-gather/reduce-scatter。 | per-parameter DTensor sharding + module-scoped communication groups。 | flexible RaggedShard data placement + structure-aware sharding/communication planner。 |
| Token mixing | 不适用 / 未单列 | 不适用 / 未单列 | 不适用 / 未单列 |
| KV / state layout | 不适用 / 未单列 | 不适用 / 未单列 | 不适用 / 未单列 |
| Selector / compressor | 无 / 未单列 | 无 / 未单列 | 无 / 未单列 |
| S · Situation | ZeRO/FairScale 证明全分片有效,但 PyTorch 用户需要更原生、与 allocator/dispatcher 协同的工业实现。 | FSDP1 的 FlatParameter 破坏原参数边界,使 tensor subclass、FP8、冻结参数、checkpoint 和多维并行组合困难。 | FSDP1/2 的固定逐元素或逐行分片与 block-wise 低精度、Muon/Shampoo 的矩阵结构冲突,在万卡规模也有通信/显存瓶颈。 |
| T · Target | 用接近本地模型的编程体验训练远超单卡容量的模型,并维持接近 DDP 的吞吐。 | 在维持相近吞吐的前提下,用逐参数分片获得更直观、可组合的表示。 | 在兼容结构化训练方法的同时,超过现有 FSDP 的吞吐和显存效率并扩至数万 GPU。 |
| A · Action / 实验 | 按 module 把参数 flatten 后分片,前/反向按需 all-gather,完成后 reshard/free,并与 CUDA allocator、prefetch 和 CPU offload 联合设计。 | fully_shard 把参数原位转为 Shard(0) DTensor;module hooks 调度 all-gather/free/reduce-scatter,并重新设计多 stream 显存管理和显式 prefetch。 | 设计允许不等长、保留结构边界的 RaggedShard,以及 structure-aware planning;在多模型、优化器、量化与大规模集群上对比现有 FSDP。 |
| R · Result | AWS scaling test 可训练 1T dense 模型;报告 GPT-1T 每 A100 84 TFLOPS、GPT-175B 每 A100 159 TFLOPS。论文显示接近 DDP 且 TFLOPS 近线性扩展。 | 官方文档定位为相对 FSDP1 保持相近 throughput;FSDP2 解除冻结参数约束、支持 communication-free sharded state dict,并带来确定性更强的显存行为。 | 论文报告比现有 FSDP 系统高 5–66% 吞吐、低 16–30% 显存,并可扩展到数万 GPU。 |
| 适用场景 | PyTorch 原生大模型训练,尤其模型状态超单卡容量但计算仍按数据并行执行。 | 需要 PyTorch 原生 composable distributed、FP8/tensor subclass、2D/3D 并行的新训练项目。 | block-wise quantized training、Muon/Shampoo 与超大规模集群训练。 |
| 计算 / 显存 | 参数、梯度、optimizer state 全分片;临时 unsharded 参数峰值取决于 wrap 粒度/prefetch。 | 全状态分片;避免 FSDP1 record_stream 模式,显存更可预测。 | 报告 +5–66% throughput、−16–30% memory;收益来自布局、通信和峰值控制共同作用。 |
| 并行维度 | Fully Sharded Data Parallel,可与 TP 等组合但 FlatParameter 降低可组合性。 | FSDP + DTensor DeviceMesh,便于组合 TP/PP/CP。 | Fully Sharded Data Parallel,目标规模到 tens of thousands GPUs。 |
| 局限 / 边界 | flatten 后参数边界、冻结参数、state_dict 与其他 parallelism 组合复杂;内存调度较难预测。 | 无自动 bucketing,通信 grouping 由 module 结构决定;API 与 FSDP1 不兼容且需要迁移。 | 截至 2026-07-19,论文结果可核验,但对应 veScale-FSDP 实现尚不能视为已公开可用;需等待代码与独立复现。 |
| 代码 / 可用性 | PyTorch 原生稳定 API;官方已建议新项目考虑 FSDP2。 | PyTorch 原生 fully_shard API 与迁移指南公开。 | 论文公开;现有 volcengine/veScale 仓库不等同论文所述 FSDP 实现。 |
| 实证 | 官方博客 · Introducing PyTorch Fully Sharded Data Parallel API ↗论文 · PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel ↗ | 官方博客 · PyTorch 2.4 Release Blog ↗代码仓 · torch.distributed.fsdp.fully_shard ↗ | 论文 · veScale-FSDP: Flexible and High-Performance FSDP at Scale ↗ |