2026年9月22日,华尔街见闻援引研究机构SemiAnalysis的技术报告称,大模型生成回答并不是由单一环节一次完成,而是一套涉及计算、存储、内存和网络调度的推理服务流程。报告将其描述为由不同工作阶段和专用节点池组成的“Token工厂”。

这套分析框架把推理划分为四个阶段:预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)。报告指出,各阶段对算力、内存带宽和网络的需求并不相同,混同处理会损失混合专家模型,也就是MoE架构的结构性优势。

在报告描述的流程中,用户或代理发出请求后,英伟达Dynamo或Mooncake等调度层会将请求放入队列,再分配给输入填充工作节点。该节点把用户输入与历史对话状态转换为新的上下文,随后交给解码工作节点;后者反复读取已经积累的状态,逐步生成回答Token。

对话过程中形成的状态以KV状态保存。报告将这些状态描述为不可变的数据块:生成后不再修改,而是随着对话继续追加。其作用是保留此前积累的上下文,使后续生成能够沿着已有内容继续推进。在智能体场景中,这套流程还可能与工具调用和外部搜索交织。

MoE进一步改变了推理系统的资源组织方式。按照报道中的解释,模型处理一个Token时不会调用全部参数,而是由路由器选择少数适合的专家模块参与计算,再汇总处理结果。因此,关键问题不再只是模型拥有多少参数,还包括哪些参数会在特定时刻被激活,以及相关数据应放置在哪里。

报告以英伟达Blackwell系列GPU作为推演案例,讨论不同推理阶段中硬件所承担的作用。其适用对象主要包括硬件设计者、云服务商和模型部署方。当前摘录提供的是架构拆分与资源需求框架,没有给出具体部署效果、性能提升幅度或不同方案的实测对比。

仅供信息参考,不构成投资建议。

原始来源:Semianalysis硬核拆解:AI回答你一句话,背后发生了什么