LLM 架构演进与推理优化:从 MHA 到 MLA 的因果链

phenix-fledgling Lv5

一句话总纲:2019 年至今 LLM 架构没有革命,只有围绕一个矛盾的持续工程优化——上下文越来越长(推理模型、Agent 都在囤 token),而注意力计算和 KV cache 的成本随长度膨胀。几乎所有架构改动都是在”省这笔钱”和”别把模型搞笨”之间找平衡。

一张图看懂现代 LLM 架构主干

人话结论:把 GPT-2 拿来,换掉 7 个零件,就得到 2025-2026 年任何一个主流开源模型的骨架。各家(DeepSeek、Qwen、Kimi、gpt-oss、Gemma)的差异只是零件参数不同。

1
2
3
4
5
6
7
8
9
Token → Embedding(RoPE 取代绝对位置编码)
→ N × Transformer Block:
RMSNorm(取代 LayerNorm)
注意力(GQA / MLA / 滑窗 / 稀疏 / 线性混合,取代 MHA)
RMSNorm
FFN → SwiGLU(取代 GELU 两层 MLP)或 MoE(取代密集 FFN)
残差连接(前沿:mHC 多路残差流)
→ RMSNorm → 输出头
(Dropout:直接删了)

GPT-2 → 现代架构的 7 个替换,每个都有因果

零件 GPT-2 时代 现在 解决什么问题 代价
Dropout 有 删除 LLM 只训 1 个 epoch,每个 token 只见一次,没有过拟合风险;实验证明 Dropout 反而伤性能 无
位置编码 绝对位置(学习的) RoPE(旋转 Q/K) 绝对位置无法外推到更长序列 超长序列需 YaRN 等缩放;近期又出现 NoPE/partial RoPE 反思(见注意力节)
激活/FFN GELU 两层 MLP SwiGLU(3 层带门控) 乘法门控交互提升表达力;Swish 比 GELU 计算便宜 多一个矩阵,但通常收窄隐层,总参数反而更少
归一化 LayerNorm RMSNorm 只除均方根、不减均值,少一次跨特征归约,更快且同样稳 无明显代价
Norm 位置 Post-Norm→Pre-Norm Pre-Norm 为主 + 变体 Pre-Norm 训练更稳不用 warmup 精调;OLMo 2 用”残差内 Post-Norm”、Gemma 3 前后双 Norm、再加 QK-Norm(RoPE 前对 Q/K 归一化)压 logit 爆炸 双 Norm 略增计算
注意力 MHA GQA / MLA / 混合 KV cache 太贵(详见下两节) 见下
FFN 密集 MoE 容量与算力解耦(详见 MoE 节) 见下

宽 vs 深(同参数量怎么摆)

  • gpt-oss 走宽(大 embedding 维度、少层),Qwen3 走深。宽模型推理并行度高、吞吐好、训练更稳;深模型表达更灵活但难训。
  • Gemma 2 的 9B 消融:宽版 52.0 vs 深版 50.8,宽略胜。结论是”差别不大,看部署硬件”。

量化与本地部署(gpt-oss 的 MXFP4 示范)

  • gpt-oss 首发即带 MXFP4 量化的 MoE 专家权重(约 4.25 bit/参数):120B 模型塞进单张 80GB H100,20B 模型 16GB 消费级显卡能跑。
  • 因果:MoE 专家权重占总参数绝对大头、且每 token 只激活一小撮,对量化误差最不敏感——所以只量化专家,注意力/embedding 等主干保持高精度,性能几乎无损。
  • 代价:MXFP4 的原生硬件加速要较新 GPU(Hopper 级起);老卡只能反量化回 bf16 跑,省下载体积不省显存算力。

工程师判断:

  • 读模型卡先看五件事:总参数/激活参数(MoE 稀疏度)、注意力类型(决定 KV cache 大小)、上下文长度与实现方式(原生 or YaRN 外推)、norm 方案(训练稳定性线索)、词表大小。
  • 面试讲架构演进,抓主线:”都是围绕训练稳定性(norm/QK-Norm)和推理成本(注意力/MoE/KV cache)两件事”,比背零件清单高一档。

注意力的演进因果链

人话结论:注意力的历史就是一部”KV cache 减肥史”。MHA→GQA→MLA 是压”每个 token 存多少”;滑窗/稀疏注意力是压”看多少个 token”;线性注意力是干脆不存历史、只留一个固定大小的记忆状态。

主线一:压缩每 token 的 KV(MHA → MQA/GQA → MLA)

变体 机制 解决什么 代价 代表
MHA 每个 Q 头配独立 K/V 头 —(基线) KV cache 最大 GPT-2、OLMo 2/3
MQA 所有 Q 头共享 1 组 KV cache 缩到 1/头数 表达力损失明显 Gemma 4 E2B
GQA 每组 Q 头共享 1 组 KV(MQA↔MHA 之间的频谱) cache 大幅缩小,性能几乎不掉 消融显示略差于 MHA Llama、Qwen3、Gemma
MLA K/V 先压缩到低维 latent 再缓存,用时上投影还原(类比 LoRA 的降/升投影) cache 比 GQA 更小 多一次矩阵乘;实现复杂 DeepSeek V2/V3/R1、Kimi K2、GLM-5
  • 因果关键:GQA 是”共享式”省内存(少存几份),MLA 是”压缩式”省内存(每份存小点)。DeepSeek-V2 消融给出反直觉结论:MLA > MHA > GQA(建模质量),压缩本身有正则化收益。
  • 但经验值:<100B 规模 GQA 更好调,MLA 的收益在大模型上才稳定兑现(Sarvam 的选择佐证:30B 用 GQA,105B 用 MLA)。

主线二:缩小注意力范围(滑窗 SWA → 学习式稀疏 DSA)

  • 滑窗注意力(SWA):每个 token 只看最近 W 个 token。换来 KV cache 和计算都封顶;丢掉的是直接的长程检索能力——所以没人全用滑窗,都是混合比例:Gemma 2(1:1,窗口 4096)→ Gemma 3(5:1,窗口 1024)→ gpt-oss(1:1,窗口仅 128)→ 小米 MiMo(5:1,128)。趋势是窗口越来越小、全注意力层越来越稀,靠少量全注意力层兜底长程依赖。
  • DSA(DeepSeek 稀疏注意力,V3.2):固定窗口太死板,改成学出来该看谁——lightning indexer 对每个历史 token 打相似度分(ReLU 打分,作用在 MLA 压缩表示上),token selector 取 top-k=2048 建稀疏掩码。复杂度 O(L²)→O(L·k)。代价:多一个 indexer 组件要训练,推理栈要写自定义 kernel。
  • DeepSeek V4 的 CSA/HCA(更激进):不再是”每 token 一条 KV”,而是沿序列维压缩——把每 4 个(CSA,配稀疏选择)或 128 个(HCA,配密集注意力)token 汇总成一条压缩 KV。1M 上下文时 KV cache 只有 V3.2 的 10%。代价:丢 token 级细节,所以两种机制交替 + 保留 128 token 的滑窗兜底。

主线三:线性/混合注意力(不存 KV,存一个状态)

  • Gated DeltaNet(Qwen3-Next、Kimi Linear):像 RNN 一样逐 token 更新一个固定大小的记忆矩阵 S。α 门控制遗忘、β 门控制写入。计算 O(n),内存与上下文长度无关。
  • 代价直白:全部历史被压进固定状态,精确检索能力差(”第 3 段第 2 句说了啥”这种查不准)。所以都是 3:1 混合——3 层线性 + 1 层全注意力,全注意力层负责精确检索。
  • Kimi Linear 的改进 KDA:把 DeltaNet 的标量门升级为通道级门控,配 MLA(NoPE)做全注意力层;对比全 MLA 架构 KV cache 省 75%、解码吞吐最高 6x。
  • 反面教材必须记住:MiniMax M1 用了线性注意力,M2 退回全注意力——官方复盘:常规 prompt 没问题,但推理链和多轮 Agent 任务精度崩,且推理基础设施对线性注意力优化不足。→ 混合注意力对 Agent 场景是”理论合适、生态未熟”。

支线:位置编码与门控的新共识

  • NoPE:SmolLM3 每 4 层去掉 RoPE、Kimi Linear 的 MLA 层全用 NoPE——因果掩码本身隐含顺序信息,不加位置编码反而长度泛化更好。
  • partial RoPE / p-RoPE:MiniMax-M2 只旋转一半维度、Gemma 4 只旋转 25%,避免超长序列”过度旋转”损伤表征。
  • Gated Attention:注意力输出乘一个 sigmoid 门(Qwen3-Next、Trinity),官方说法是消除 attention sink 和巨激活、稳训练。gpt-oss 用的是另一招:给每个头加一个可学习的 sink logit(虚拟”不看任何人”选项)。

工程师判断:

  • 选型口诀:GQA 是稳健默认;大模型(>100B)看 MLA;长上下文/Agent 高吞吐需求看混合线性,但先确认推理框架(vLLM/SGLang)支持成熟度——Raschka 本人实测:本地跑经典 GQA 架构的 tok/sec 反而高于混合架构,因为 kernel 优化到位。
  • 读模型卡看 num_key_value_heads(<num_attention_heads 即 GQA,=1 即 MQA)、滑窗比例与窗口、是否混合线性层。
  • 面试讲 MHA→GQA→MLA:动机全是 KV cache,GQA 靠共享、MLA 靠压缩,MLA 反超 MHA 是意外之喜。

KV Cache 与推理成本

人话结论:KV cache 是”用内存换计算”——不缓存,每生成一个 token 都要对全部历史重算 K/V(计算 O(n²));缓存了,每步只算新 token(O(n)),但内存随上下文线性涨。它就是长上下文贵的根源,也是上一节所有花活的靶子。

为什么存在

自回归生成时,历史 token 的 K、V 在每一步都完全相同。不缓存 = 每步重复劳动。Raschka 实测:124M 小模型 CPU 生成,加 KV cache 5x 加速。

实现要点(读源码/自己写时的检查清单)

1
2
3
4
5
6
7
8
# 核心逻辑:新 token 的 KV 拼到缓存尾部,注意力对全缓存计算
if use_cache:
if self.cache_k is None:
self.cache_k, self.cache_v = keys_new, values_new
else:
self.cache_k = torch.cat([self.cache_k, keys_new], dim=1)
self.cache_v = torch.cat([self.cache_v, values_new], dim=1)
keys, values = self.cache_k, self.cache_v
  • 必须维护 current_pos 追踪位置(RoPE/掩码要用真实全局位置,不是本次输入的相对位置)。
  • 每个新序列前必须 reset_cache(),否则上一条对话的 KV 串进来,输出静默污染。
  • 生产级优化:预分配 max_seq_len 大张量代替反复 torch.cat(避免内存碎片和拷贝);滑窗截断 cache_k[:, :, -window_size:, :] 给内存封顶。

内存账(为什么大家拼命压它)

KV cache ≈ batch × 层数 × n_tokens × kv头数 × head_dim × 2(K和V) × 字节数

四个可压的因子对应四类手段:

压哪个因子 手段 幅度示例
kv 头数 GQA / MQA 头数缩到 1/4~1/头数
head_dim(每份大小) MLA 压缩、CCA(ZAYA1:直接在压缩空间做注意力,连 FLOPs 也省) —
n_tokens 滑窗截断、DSA top-k、CSA/HCA 序列压缩 V4 在 1M 上下文压到 V3.2 的 10%
层数 跨层 KV 共享(Gemma 4:35 层只有前 15 层算 KV,后 20 层复用同类型前层的 KV) 约省一半;E2B 在 128K 省 2.7GB
(彻底不存) 线性注意力固定状态:n_heads × head_dim²,与长度无关 3:1 混合下 cache 曲线近乎平

代价共性:所有压缩都是有损近似,压过头掉检索精度——这就是为什么每个方案都留”兜底”(全注意力层、滑窗分支、混合比例)。

工程师判断:

  • 估算部署内存 = 权重 + KV cache 峰值。长上下文 Agent 场景 KV cache 常反超权重成为大头,选型时先按目标上下文长度算 KV 账再看跑分。
  • 排查”生成越长越慢/OOM”先查:有没有启用 cache、有没有预分配、多会话是否隔离 cache。
  • 面试可讲的深度点:KV cache 为什么不缓存 Q?——因为每步只需要当前 token 的 Q 去查全部历史 K/V,历史 Q 用不上。

MoE 稀疏化

人话结论:MoE 把一个大 FFN 换成 N 个小 FFN(专家)+ 一个路由器,每个 token 只激活其中几个。目的是把”知识容量”和”每 token 计算量”解耦:模型可以有 1T 参数的知识,但每个 token 只花 30B 的算力。

机制与因果

  • 解决什么:密集模型要更多容量就得全量加参,训练和推理成本同步涨。
  • 怎么解:router(一个小线性层)给每个 token 挑 top-k 个专家,只跑这几个。DeepSeek V3:671B 总参 / 37B 激活,256 个专家每 token 激活 9 个(8 路由 + 1 共享)。
  • 代价:①权重仍要全部装进显存(省算不省存);②路由不均衡需要辅助损失/技巧;③微调和 RL 更难伺候(Gemma 4 特意同时出 MoE 版和 dense 版,dense 版就是给后训练用户的)。

两个设计分歧(读模型卡时的鉴别点)

分歧 路线 A 路线 B 现状
共享专家 有(DeepSeek V3、GLM-4.5、Qwen3-Next):1 个专家常开,接住通用模式,让其余专家更专精 无(Qwen3):官方解释是推理优化收益不明显 Qwen3-Next 又加回来了——共享专家略占上风
专家形状 多而小(DeepSeekMoE 路线,256 个小专家):组合灵活、专精度高 少而大(gpt-oss 32 个、Llama 4 Maverick 激活 2 个大专家、Mistral 3、Trinity):推理吞吐和部署友好 多小专家是主流,少大专家是吞吐派

稀疏度竞赛(激活参数占比一路走低)

Qwen3 235B-A22B 约 9.4% → MiniMax-M2 4.37% → DeepSeek V4-Pro 是目前最稀疏的旗舰。趋势含义:总参代表知识上限,激活参代表单 token 成本,两者比值越极端,”存储换算力”的杠杆越大。

其他工程细节:GLM-4.5/V3 前几层用 dense(路由在浅层不稳);ZAYA1 极端到每 token 只激活 1 个路由专家。

工程师判断:

  • 部署自查三问:显存装得下总参数吗?框架支持专家并行吗?我的场景是吞吐敏感(考虑少大专家模型)还是质量敏感?
  • 微调选型:MoE 后训练坑多,个人/小团队优先 dense 版本或走 LoRA。
  • 面试一句话:MoE 的本质是”每 token 的条件计算”,与 KV cache 优化正交——一个省 FFN 的算力,一个省注意力的内存,2025 年后旗舰模型两个都要。

推理时扩展(inference-time scaling)与 reasoning effort

人话结论:提升模型效果有两个独立旋钮——训练时多花钱(更大模型/更多数据/RLVR)、推理时多花钱(多生成 token、多采样几次)。Reasoning effort 就是把第二个旋钮做成产品开关。两条曲线会交叉:小模型开高 effort 常能追平大模型开低 effort,这是成本优化的核心依据。

推理模型的底层事实(祛魅三连)

  1. “推理模型”= 输出中间推理轨迹(reasoning trace)再给答案的模型,不是真的像人一样思考。
  2. <think></think> 标签是装饰性的:只为让 UI/管线分离思考与答案,靠 RLVR 阶段的格式奖励(R = R_accuracy + R_format)训出来,换任何分隔符效果一样。能力来自 RLVR 本身——只用可验证的最终答案对错(数学用符号校验、代码用测试)做奖励,模型就自发学会分步、回溯、自我纠错(”Aha 时刻”);推理轨迹本身不进 loss。
  3. 2025 年后几乎所有旗舰模型都是 RLVR 训过的,”是不是推理模型”已经是伪问题,真问题是”推理开关怎么控制”。

从开关到旋钮:控制方式演进

代际 形态 实现 代表
1. 专用模型 想省 token 就换模型 独立后训练 V3(不想)/R1(想,且关不掉)
2. 混合开关 同一模型 on/off Thinking Mode Fusion:SFT 混入 /think 和 /no_think 样本;关=硬塞空 <think></think> Qwen3、GLM-5、Nemotron
3. 档位 effort low/medium/high 系统提示写 “Reasoning effort: high” + 训练期按档位配不同长度惩罚(RL)或不同长度目标(SFT) gpt-oss、GPT-5 系
4. 连续值 0.0~1.0 RL 中 λ(e) 按 effort 值调 per-token 成本 Inkling
  • 摇摆史插曲:Qwen3 首发主打混合开关,2507 版本又拆回 Instruct/Thinking 两个专用模型(官方称混合模式拖累基础质量);随后 GLM/Kimi/DeepSeek 用更精细的配方证明单模型多档可行——“混合伤性能”是配方问题,不是原理缺陷。

  • 训练侧套路总结(六家旗舰对比后的共性):① SFT/模板引入模式标签;② RL 阶段按模式给不同上下文窗口和长度惩罚(DeepSeek V4 甚至分别训 Non-think/Think-High/Think-Max 三个专家再蒸馏回一个模型;Kimi K3 训 3 域×3 档共 9 个专家再多师蒸馏);③ 抗截断鲁棒性训练——Nemotron 用随机截断的推理轨迹做 SFT,Qwen3 支持推理中途被强停后直接出答案。

  • Kimi K2.5 的 Toggle:预算 RL 和自由 RL 交替,token 用量降 25-30% 而分数几乎不掉——证明”废话推理”有很大压缩空间。

  • 效果规律:effort↑ → token↑ → 准确率↑,但边际递减明显,最高档常不经济(GPT-5.6 曲线、Inkling 数据一致)。

effort 之外的推理时扩展武器库

CoT 提示 → 自一致性(采样 N 次多数投票)→ Best-of-N + 验证器 → 自我改进(self-refinement)→ 搜索。极端案例:DeepSeekMath-V2 用”生成器 + 验证器 + 元验证器”三 LLM 体系(GAN 式左右互搏)+ 大量采样,把开源模型推到奥数金牌水平——证明推理时堆算力可以买到训练买不到的上限,代价是延迟和费用爆炸,只适合准确率压倒一切的场景。

工程师判断:

  • Agent 成本优化第一杠杆:按任务难度路由 effort,简单工具调用用 low、规划/调试用 high;Raschka 预判 harness 内置自动路由是下一步,但显式覆盖入口要留。
  • 选开源模型做 Agent,查模型卡三件事:effort 怎么传(系统提示/chat_template_kwargs/API 参数)、有没有硬 token 预算能力、被截断后能否正常出答案。
  • 面试高分角度:训练 scaling 与推理 scaling 是两条可交叉的成本曲线,报价/延迟约束下解的是”选哪个模型 × 开多大 effort”的二维优化,不是”选最强模型”。

2025-2026 架构趋势总结

人话结论:transformer 没被取代,但转向”为长上下文和 Agent 场景做架构特化”。质的提升更多来自数据、RLVR 配方和推理时手段,架构改动主要在降成本。

  1. 长上下文效率是唯一主旋律:KV 共享(Gemma 4)、按层注意力预算(Laguna)、压缩空间注意力(ZAYA1 CCA)、序列压缩(V4 CSA/HCA)、混合线性(Qwen3-Next/Kimi Linear/Nemotron 的 Mamba-2)——全部服务于”reasoning + Agent 囤 token”的现实。
  2. 收敛与分叉并存:主干高度趋同(Mistral 3 直接采用 DeepSeek V3 架构;各家互相抄零件),同时出现分叉实验——文本扩散模型(并行去噪、低延迟场景,Gemini Diffusion 将首发工业级;短板:难流式输出、难工具调用)、代码世界模型(学”代码跑起来会发生什么”)、微型递归模型(TRM 700 万参数刷 ARC,未来可能成为大 LLM 的”推理工具”)。目前都不动摇自回归 transformer 的 SOTA 地位。
  3. 残差流开始被动刀:DeepSeek 的 mHC(多路并行残差流 + 双随机矩阵约束混合,训练开销仅 +6.7%)进了 V4 旗舰——注意力/FFN 之外的最后一块处女地也开工了。
  4. GRPO 工程化成熟:DAPO/Dr. GRPO 系列技巧(去 KL、clip-higher、token 级 loss、截断重要性采样等)已是标配,RL 训练从”玄学易崩”变成可复现工程。2026 预期:RLVR 扩到数学/代码之外的可验证域。
  5. 复杂度警告:基础 transformer block ≈ 50-100 行 PyTorch,现代旗舰的 attention 花活让代码复杂度 ~10x。学习路径建议保持 Raschka 式打法:从 GPT-2 起点一次加一个零件。
  6. Benchmaxxing 时代的评估观:公开榜单只能做门槛筛选(低于阈值→淘汰),不能做排序依据(Llama 4 高分翻车为鉴);上手实测 + 自建任务集不可替代。
  7. MTP(多 token 预测)走向标配:训练时让模型同时预测后面第 1、2 个 token(DeepSeek V3、Qwen3-Next、GLM-4.5 均采用),训练信号更密;推理时该模块可直接当自带草稿头做投机解码。代价:多一份头部训练开销,推理框架要支持”起草-验证-回退”逻辑。
  8. 优化器换代苗头:Muon(矩阵正交化更新)在 Kimi K2(1T 参数)上完成首次万亿级验证,损失曲线更平稳,是 AdamW 长期统治后第一个被旗舰模型采信的挑战者,2026 多家跟进。
  9. 训练成本祛魅:DeepSeek V3 “$5.5M 训练成本”只算最后一次预训练的 GPU 租金,不含消融、失败 run、人力与数据——读任何”XX 百万美元训出旗舰”的新闻先问口径。

附:关键数字速查表

选型估算和面试时可直接引用的硬数字(均出自精读素材):

数字 含义
5x 124M 模型 CPU 生成启用 KV cache 的加速比
1/10 DeepSeek V4 在 1M 上下文的 KV cache 相对 V3.2
27% V4 长上下文注意力 FLOPs 相对 V3.2
75% / 6x Kimi Linear 相对全 MLA:KV cache 节省 / 解码吞吐提升
2.7GB Gemma 4 E2B 跨层 KV 共享在 128K 上下文省下的显存(bf16)
3:1 线性混合架构的主流层比(3 线性 : 1 全注意力)
128 gpt-oss / MiMo / V4 滑窗兜底的窗口 token 数
671B / 37B DeepSeek V3 总参 / 激活参(256 专家激活 9 个)
4.37% MiniMax-M2 激活参数占比(稀疏度竞赛代表)
2048 DSA lightning indexer 的 top-k 选取数
25-30% Kimi K2.5 Toggle 训练带来的推理 token 用量下降
+6.7% mHC 多路残差流的训练额外开销
7M / $500 TRM 递归小模型的参数量 / 训练成本(刷 ARC)

延伸阅读(源文件)

精读(Raschka,均在 博客素材/raschka/):

  • 2025-07-19_The_Big_LLM_Architecture_Comparison.md —— 23 个开源架构逐个拆解,本文架构主干与 MoE 节的主素材
  • 2026-03-22_A_Visual_Guide_to_Attention_Variants_in_Modern_LLMs.md —— MHA/GQA/MLA/SWA/DSA/门控/混合全景
  • 2025-06-17_Understanding_and_Coding_the_KV_Cache_in_LLMs_from_Scratch.md —— KV cache 从零实现 + 优化
  • 2025-12-03_From_DeepSeek_V3_to_V3.2__Architecture,_Sparse_Attention,_and_RL_Updates.md —— MLA/DSA/GRPO 更新细节
  • 2025-08-09_From_GPT-2_to_gpt-oss__Analyzing_the_Architectural_Advances.md —— 7 个零件替换的因果 + MXFP4/宽深
  • 2026-07-18_Controlling_Reasoning_Effort_in_LLMs.md —— effort 档位六家旗舰训练配方对比
  • 2026-05-16_Recent_Developments_in_LLM_Architectures__KV_Sharing,_mHC,_and_Compressed_Attention.md —— KV 共享/PLE/CCA/mHC/CSA-HCA
  • 2025-11-04_Beyond_Standard_LLMs.md —— 线性混合/文本扩散/世界模型/递归小模型
  • 2025-12-30_The_State_Of_LLMs_2025__Progress,_Problems,_and_Predictions.md —— 年度综述与预测
  • 2026-01-24_Categories_of_Inference-Time_Scaling_for_Improved_LLM_Reasoning.md —— 推理时扩展分类(本地版被付费墙截断,仅概览可读)

浏览(相关但未深挖):

  • lilianweng/2025-05-01_Why_We_Think.md、2023-01-27_The_Transformer_Family_Version_2.0.md、2023-01-10_Large_Transformer_Model_Inference_Optimization.md —— 本地存档均为开头截断的 stub,仅存标题与首段,可按 source 链接读原文
  • jayalammar/ —— 以 2020-2023 图解入门为主(图解 GPT-3 等),与本主题重叠但深度已被 Raschka 素材覆盖
  • 标题: LLM 架构演进与推理优化:从 MHA 到 MLA 的因果链
  • 作者: phenix-fledgling
  • 创建于 : 2026-07-29 15:00:00
  • 更新于 : 2026-07-29 20:17:45
  • 链接: https://blog.xugua.xyz//post/LLM 架构演进与推理优化:从 MHA 到 MLA 的因果链.html
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论