Zenn LLM6/16/2026
AttentionとFFNを分離するAFD推論アーキテクチャ
原題: Attention と FFN を分離 ── AFD (Attention-FFN Disaggregation)
AIによる日本語要約
大規模MoEモデルのデコード推論で、メモリ帯域制約の多いAttentionと演算器利用率の低いFFNを物理的に分離するAFD手法が提案されました。
- AFDはAttentionとFFNを別々のGPUプールに分離する推論アーキテクチャである。
- 各プールを独立に最適化でき、バッチサイズと並列度を個別に調整できる。
- StepFun、ByteDance、Huaweiが先行研究と設計を体系化している。
※ Claude Haiku 4.5 による自動要約です。原文を必ず確認してください。