一张表看懂 2026 年主流大模型的架构选择

从 Kimi K2.5 到 DeepSeek V4,我把 27 个主流开源模型的 FFN、注意力、归一化、位置编码方案整理成一张对比表,每个技术选型都附上论文出处和我的核对笔记。

今年 1 月到 4 月,开源大模型迎来一波密集发布:Kimi K2.5、Qwen3.5、DeepSeek V4、GLM-5、Gemma 4、Nemotron 3,二十多个模型接力出场。追这些发布会的时候我发现一个现象:各家架构说明里的关键词越来越像,翻来覆去就是 RMSNorm、RoPE、GQA、MoE 这几样。是真没得选了,还是每个位置都有讲究?我把这 27 个模型的技术报告翻了一遍,把每个模块的选型抄进同一张表,整理成这篇文章:一张汇总大表,加上每个模块的技术方案详解,能找到论文的都贴了论文地址。

先说核对结论:绝大部分选型和公开资料对得上。两处需要留意——DeepSeek V4-Pro 的激活参数,我按 SemiAnalysis 架构页给的 49B 填的;它的注意力配置,论文摘要把 V4 系列整体写成 CSA+HCA 混合,但没给出 Pro 的逐层明细,表格里用脚注标了出处。除此之外没有发现硬伤。

配图说明:文中架构图除特别标注外,取自 Sebastian Raschka 的《The Big LLM Architecture Comparison》和各模型论文,版权归原作者。表格数据逐行对照官方技术报告和模型配置做了交叉核对。

2025-2026 主流开源模型架构总览
Raschka 整理的架构分支图。左上是标准 Transformer 系,右下的 hybrid 模型们是 2026 年的新势力。

汇总大表

列的含义先交代一下:FFN 列的 Sparse 指 MoE(每 token 只激活部分专家)、Dense 指稠密前馈;归一化列合并了 Pre-Norm / Post-Norm / Attention 内部的 Norm 三个位置;Attention 列按”主要机制 + 辅助机制”写,比例我标在括号里。编号从 0 开始,只收录 2026 年 1 月之后发布的模型,更早的不在本文统计范围内。

#模型发布日期上下文参数(总/激活)归一化位置编码Attention残差FFN激活函数技术报告
0Kimi K2.5 (1T)2026/01/27256K1T / 32BRMSNorm (Pre)RoPEMLARCSparseSiLUarXiv:2602.02276
1Arcee Trinity Large (400B)2026/01/27512K400B / 13BRMSNorm (Pre+Post) + QK-RMSNormRoPE+NoPEGQA + SWA (3:1)RCSparseSiLUGitHub 技术报告
2Step 3.5 Flash (196B)2026/02/01262K196B / 11BRMSNorm (Pre)RoPEGQA + SWA (3:1)RCSparseSiLUarXiv:2602.10604
3Nanbeige 4.1 (3B)2026/02/10262K3B / 3BRMSNorm (Pre)RoPEGQARCDenseSiLU
4GLM-5 (744B)2026/02/11203K744B / 40BRMSNorm (Pre)RoPEMLA + DSARCSparseSiLUarXiv:2602.15763
5MiniMax-M2.5 (230B)2026/02/12197K230B / 10BRMSNorm (Pre) + QK-RMSNormRoPEGQA(全注意力)RCSparseSiLUarXiv:2605.26494
6Tiny Aya (3.35B)2026/02/138K3.35B / 3.35BLayerNormRoPE+NoPEGQA + SWA (3:1)RCDenseSiLU复现笔记
7Ling 2.5 (1T)2026/02/15256K1T / 63BRMSNorm (Pre)RoPEMLA + LightningAttnRCSparseSiLUHF 模型卡
8Qwen3.5 (397B)2026/02/16262K397B / 17BRMSNorm (Pre)RoPEGatedAttn + DeltaNet (3:1)RCSparseSiLUHF 配置
9Sarvam (105B)2026/03/03131K105B / 10.3BRMSNorm (Pre) + KV-LayerNormRoPE+NoPEMLARCSparseSiLU官方博客
10Sarvam (30B)2026/03/03131K30B / 2.4BRMSNorm (Pre) + QK-RMSNormRoPEGQARCSparseSiLU官方博客
11Nemotron 3 Super (120B)2026/03/111M120B / 12BRMSNorm (Post)RoPEGQA + Mamba-2RCSparseSiLUarXiv:2604.12374
12Mistral Small 4 (119B)2026/03/16256K119B / 6.63BRMSNorm (Pre)RoPEMLARCSparseSiLUHF 模型卡
13Nemotron 3 Nano (4B)2026/03/16262K4B / 4BRMSNorm (Post)RoPEGQA + Mamba-2RCDenseSiLUHF 博客
14MiniMax M2.7 (230B)2026/03/18197K230B / 10BRMSNorm (Pre) + QK-RMSNormRoPEGQA(全注意力)RCSparseSiLU官方公告
15Gemma 4 (31B)2026/04/02256K30.7B / 30.7BRMSNorm (Pre+Post) + QK-RMSNormRoPEGQA + SWA (5:1)RCDenseGELUHF 模型卡
16Gemma 4 (26B-A4B)2026/04/02256K25.2B / 3.8BRMSNorm (Pre+Post) + QK-RMSNormRoPEGQA + SWA (5:1)RCSparseGELUHF 模型卡
17Gemma 4 (E4B)2026/04/02128K8B / (4.5B)RMSNorm (Pre+Post) + QK-RMSNormRoPEGQA + SWARCDenseGELUHF 模型卡
18Gemma 4 (E2B)2026/04/02128K5.1B / (2.3B)RMSNorm (Pre+Post) + QK-RMSNormRoPEGQA + SWARCDenseGELUHF 模型卡
19GLM-5.1 (744B)2026/04/07203K744B / 40BRMSNorm (Pre)RoPEMLA + DSARCSparseSiLUGLM-5 仓库
20Qwen3.6 (35B-A3B)2026/04/15262K35B / 3BRMSNorm (Pre)RoPEGatedAttn + DeltaNet (3:1)RCSparseSiLUHF 模型卡
21Kimi K2.6 (1T)2026/04/20256K1T / 32BRMSNorm (Pre)RoPEMLARCSparseSiLUHF 模型卡
22Xiaomi MiMo-V2.5 (310B)2026/04/221M310B / 15BRMSNorm (Pre)RoPEGQA + SWA (5:1)RCSparseSiLUHF 模型卡
23Qwen3.6 (27B)2026/04/22262K27B / 27BRMSNorm (Pre)RoPEGatedAttn + DeltaNet (3:1)RCDenseSiLU官方博客
24Ling 2.6 (1T)2026/04/23262K1T / 63BRMSNorm (Pre)RoPEMLA + LightningAttn (7:1)RCSparseSiLUHF 模型卡
25DeepSeek V4-Pro (1.6T)2026/04/241M1.6T / 49B*RMSNorm (Pre)RoPEGQA*mHCSparseSiLUarXiv:2606.19348
26DeepSeek V4-Flash (284B)2026/04/241M284B / 13BRMSNorm (Pre)RoPEMLA + CSA/HCAmHCSparseSiLUarXiv:2606.19348

* V4-Pro 的激活参数 49B 取自 SemiAnalysis 的架构页;注意力列按论文摘要,V4 系列整体是 CSA+HCA 混合注意力,Pro 的逐层配置建议以 官方 config.json 为准。

几个一眼能看出来的事实:27 个模型里只有 7 个是 Dense(Nanbeige、Tiny Aya、Nemotron 3 Nano 4B、Gemma 4 三档、Qwen3.6 27B),剩下 20 个全上了 MoE;位置编码清一色 RoPE 系(纯 RoPE 或 RoPE+NoPE 混合),绝对位置编码彻底退场;激活函数只有 Gemma 4 一家用 GELU,其他全是 SiLU 系的 SwiGLU;残差连接 25 家用最朴素的 RC,只有 DeepSeek V4 换成了 mHC。真正拉开差距的战场在 Attention 和归一化这两列。

下面按模块拆开讲。

归一化:放哪比用什么更要紧

表格里归一化这一列其实叠了三个问题:Norm 用什么(RMSNorm 几乎垄断,只有 Tiny Aya 还在用 LayerNorm)、放在哪(Pre 还是 Post)、以及注意力内部要不要额外加 Norm(QK-Norm)。

Pre-Norm 与 Post-Norm

2017 年的原版 Transformer 用的是 Post-LN:归一化放在注意力和前馈层之后。GPT-2 之后大家全换成 Pre-LN,原因是 Xiong et al. 2020 证明了 Pre-LN 在初始化时梯度更稳,训练深层网络不容易炸。代价是 Pre-LN 的表达上限略低,这个争论沉寂了几年。

2025 年 OLMo 2 把它翻了回来。他们的做法是:把 RMSNorm 放回注意力/FFN 之后,但保留在残差分支内部——不是回到原版 Post-LN,而是”残差内的 Post-Norm”。实验里这样做训练损失明显更稳。OLMo 2 技术报告:arXiv:2501.00656

Pre-Norm、Post-Norm 与 OLMo 2 的变体对比
左:Post-LN(原版 Transformer);中:Pre-LN(GPT-2 以来的主流);右:OLMo 2 的 Post-Norm,Norm 回到子层之后但留在残差分支里。

2026 年的表格里,Nemotron 3 系列延续了 Post-Norm 路线,Gemma 4 和 Trinity 走的是”两头都放”的 Sandwich 路线,其余主流模型仍然是标准 Pre-Norm。三种流派并存,说明这个问题没有定论——大家只是各自找到了能训稳自己模型的配置。

Sandwich Norm:两头都包

Gemma 系列从 Gemma 2 开始就在注意力模块前后各放一个 RMSNorm。这个结构便宜(RMSNorm 的开销可以忽略),图个安心。

Gemma 3 的归一化位置(Gemma 4 沿用)
Gemma 3/4 的三明治结构:Pre 和 Post 各一个 RMSNorm,注意力内部再加 QK-Norm。

Trinity Large 在此基础上玩了个新花样:depth-scaled sandwich norm,后置 RMSNorm 的增益按 1/√L 初始化(L 是总层数)。训练早期残差更新小,随着训练推进逐渐放大。这是我在主流模型里第一次见到这种初始化技巧,他们的技术报告里说这样能缓解 attention sink、稳住长序列训练。

QK-Norm:压住注意力的 logits

QK-Norm 就是在 Q 和 K 进 RoPE 之前各加一个 RMSNorm,防止注意力 logits 爆掉。思路来自 2023 年的 Scaling Vision Transformers,OLMo 2、Gemma 2/3/4、Sarvam 30B 都在用。

MiniMax M2 系列做了一个变体:per-layer QK-Norm。普通 QK-Norm 的缩放参数跨注意力头共享,MiniMax 给每个头独立的 RMSNorm 参数。代码可见 vLLM 的实现

KV-LayerNorm:Sarvam 的私有配方

Sarvam 105B 在 KV 侧加了 LayerNorm 配合 MLA 使用,这是表格里唯一一例。官方没给太细的消融,Raschka 的架构画廊把它标注为 “MLA with KV LayerNorm and NoPE + RoPE”。属于小众但值得记录的设计。

位置编码:RoPE 一统天下,然后开始做减法

RoPE(旋转位置编码)已经是绝对主流,2026 年的看点是谁在 RoPE 上做减法。

Partial RoPE(p-RoPE):只给一部分维度做旋转。MiniMax 系列只旋转一半的 head 维度,官方说法是这样能做长度外推而不掉点(MiniMax-01 技术报告);Gemma 4 更激进,只给 25% 的频率对加位置信息,理由是减少长上下文下的位置噪声。

NoPE(无位置编码)2023 年的论文发现因果掩码本身已经隐含了位置信息,完全可以不加显式位置编码,而且长度外推反而更好。

RoPE+NoPE 混合成了 2026 年的一个流行配方:滑动窗口层用 RoPE,全局注意力层用 NoPE。Trinity Large、Tiny Aya 都是这个做法(Kimi Linear 的 MLA 全局层也是 NoPE,作者说这让 MLA 在推理时能按 MQA 跑,还省掉了长上下文的 RoPE 重调)。位置编码从”必须精心设计”变成了”可以按层裁剪的组件”。

注意力:真正的战场

这一列信息量最大。把 27 个模型的 Attention 列归拢一下,大概是四条路线。

路线一:GQA + 滑动窗口,性价比组合

GQA(分组查询注意力,arXiv:2305.13245)让多个 Query 头共享一组 KV 头,KV cache 直接按比例缩小,效果几乎不掉,从 Llama 2/3 时代就是标配。

MHA 与 GQA
MHA(左)每个头独立 KV;GQA(右)分组共享,图中 4 个 Query 头共享 2 组 KV。

滑动窗口注意力(SWA)更狠:每个 token 只看附近固定窗口,KV cache 与序列长度解耦。思想来自 Longformer,Gemma 3 把它推成主流配方——5 层 SWA 配 1 层全局注意力,窗口 1024。Gemma 4 延续 5:1 比例,还把全局层的 value 直接复用 key(v=k)进一步砍 cache。

全局注意力 vs 滑动窗口注意力
左边全局注意力,每个 token 能看全序列;右边 SWA 只看窗口内。Gemma 3 的消融显示对困惑度影响极小。

2026 年这条路线的玩家:Gemma 4(5:1,窗口 1024)、Step 3.5 Flash(3:1,窗口 512)、Trinity(3:1,窗口 4096)、Tiny Aya(3:1)、MiMo-V2.5(5:1,窗口 128——目前已知最激进的窗口,配 1M 上下文用)。Step 3.5 Flash 的论文专门解释了为什么选 SWA 而不是线性注意力:SWA 与 MTP投机解码兼容得好,且窗口固定后多加 Query 头(64→96)不增加长上下文开销。

Gemma 4 与 Gemma 3 的架构对照
Gemma 4(右)和 Gemma 3(左)放在一起几乎看不出区别,最大的变化藏在全局层里:value 直接复用 key,外加 p-RoPE。

路线二:MLA,DeepSeek 系的压缩哲学

MLA(多头潜在注意力)是 DeepSeek-V2 引入的(arXiv:2405.04434):把 KV 压缩到一个低维 latent 向量存进 cache,用的时候再投影回去。GQA 是”少存几份 KV”,MLA 是”存压缩版 KV”,压缩比更狠(DeepSeek-V2 的 latent 是 576 维)。DeepSeek-V2 论文的消融显示 MLA 效果还略好于 MHA,这是它敢替换 GQA 的底气。

MLA 与 MHA 的对比
MLA 把 KV 压缩到低维 latent 存储,推理时上采样还原,KV cache 显著缩小。

2026 年 MLA 已经走出了 DeepSeek:Kimi K2.5/K2.6、GLM-5/5.1、Ling 2.5/2.6、Mistral Small 4、Sarvam 105B 都在用。GLM-5 的技术报告里有个细节值得一看:他们发现 Muon 优化器下 576 维 latent 的 MLA 打不过 GQA-8,于是把 head dim 从 192 提到 256、头数减 1/3(他们叫 MLA-256)才追平——MLA 不是免检的,超参数要跟着训练配方一起调。

GLM-5 与 GLM-4.5 的架构对照
GLM-5(右)相比 GLM-4.5(左):换上 MLA + DSA,专家从 160 个加到 256 个,层数反而从 92 减到 78。

路线三:稀疏注意力,服务超长上下文

GQA/MLA 省的是 KV cache 显存,但注意力的计算量还是 O(n²)。要做百万级上下文,得让每个 token 别看全部历史。

DSA(DeepSeek Sparse Attention):V3.2 引入(arXiv:2512.02556)。一个轻量的 lightning indexer 给每个 token 打分,选出少量相关 token 做精细注意力,其余粗略处理。V3.2 之后,GLM-5 直接在继续预训练阶段接入 DSA(他们的消融显示长上下文基准上 DSA 版优于 MLA-only 版),Kimi 的 K2.5 沿用 MLA 不动。

DeepSeek V3.2 的 MLA + 稀疏注意力
V3.2 架构:MLA 基础上加 DSA 稀疏化,V4 的 CSA/HCA 是这条路线的进一步压缩。

CSA/HCA:V4(arXiv:2606.19348)把稀疏化再推一步,CSA(压缩稀疏注意力)和 HCA(重度压缩注意力)逐层交替。官方数字:1M token 场景下单 token 推理 FLOPs 只有 V3.2 的 27%,KV cache 只有 10%。这是”注意力不再把历史当作扁平 token 列表”这个思路的极致版本。

路线四:线性注意力回归,混合架构当道

线性注意力(O(n) 复杂度)在 2020 年前后火过一阵,因为掉点严重被雪藏。2025 年下半年开始翻红,Raschka 画的时间线很直观:

线性注意力混合架构时间线
2025 下半年起,MiniMax-M1、Qwen3-Next、DeepSeek V3.2、Kimi Linear 相继转向高效注意力混合。

Gated DeltaNet:Qwen3.5/3.6 的选择。DeltaNet 用 delta rule 增量更新一个固定大小的记忆矩阵(可以理解为可学习的快速权重 RNN),Gated 版本加上 Mamba 式的门控衰减(arXiv:2412.06464)。纯线性注意力检索精度不够,所以 Qwen 用 3:1 的比例穿插全注意力层——3 层 Gated DeltaNet 配 1 层 Gated Attention。

Qwen3-Next 的混合注意力结构(Qwen3.5 沿用)
3 层 Gated DeltaNet + 1 层 Gated Attention 为一组循环堆叠。Gated Attention 就是普通注意力加输出门。

Lightning Attention:MiniMax-01 引入(arXiv:2501.08313),Ant Group 的 Ling 系列接棒。Ling 2.6 用 MLA + Lightning Attention 7:1 混合,官方说这是从 GQA 架构平滑迁移过来的(HF 模型卡里有迁移流程)。有意思的是 MiniMax 自己在 M2 上放弃了线性注意力回到全注意力——官方理由是线性注意力在推理和多轮对话任务上精度不佳——结果 Ling 和 Kimi 又证明配比得当就能用。这条路线的争议还没完。

Mamba-2:NVIDIA Nemotron 3 的选择(arXiv:2405.21060)。比 Qwen 更激进,绝大多数层都是 Mamba-2(固定大小的状态,常数开销),只留少量 GQA 层当”锚”维持全局检索。Nano 4B 是端侧模型,Super 120B 支持 1M 上下文。

Nemotron 3 Super 的混合架构
Nemotron 3 Super:Mamba-2 层承载大部分序列建模,稀疏的注意力层做全局锚点,外加 LatentMoE 和 MTP。

Kimi Linear 是这条路线的集大成者:KDA(Kimi Delta Attention,把 Gated DeltaNet 的标量门控细化到每个通道)配 gated MLA,3:1 混合。论文:arXiv:2510.26692。表格里没有 Kimi Linear(它发布于 2025 年 10 月,不在本文统计范围内),但理解 Qwen3.5 的 DeltaNet 时值得对照着看。

Kimi Linear 与 Qwen3-Next 的对照
同为 3:1 混合,Kimi Linear 把线性层换成 KDA、全注意力层换成 gated MLA,并在 MLA 层用 NoPE。

Gated Attention 顺带说一句:它不是独立路线,而是贴在全注意力上的小补丁——输出加一个 sigmoid 门再进残差,来源是 arXiv:2505.06708。作用是消除 attention sink、稳住 massive activation。Qwen 系和 Step 3.5 Flash(head-wise 门控)在用,Trinity 也用了类似门控。

Trinity 的注意力门控
Trinity Large 的门控:在缩放点积之后、输出投影之前加逐元素门。

FFN:MoE 的细粒度化

表格里 Sparse 的 20 个模型全走 MoE 路线,而 MoE 的当代形态基本由 DeepSeekMoE 定义(arXiv:2401.06066):把大专家拆成更多小专家(细粒度),再加一个每个 token 必过的共享专家。小专家提升组合表达的灵活性,共享专家承接通用知识,避免每个路由专家都去学一遍常见模式。

MoE 模块结构
MoE 把单个 FFN 换成 N 个专家 FFN + 路由器,每个 token 只激活其中少数几个。
DeepSeekMoE 的细粒度专家 + 共享专家
上:传统 MoE,少量大专家;下:DeepSeekMoE,更多小专家加一个共享专家(Always-on)。

这个趋势在 2026 年的数字里看得很清楚:GLM-5 每层 256 个专家(8 路由 + 1 共享),Step 3.5 Flash 288 个(top-8),Nemotron 3 Super 干脆上到 512 个(top-22)。也有逆行的:gpt-oss 只有 32 个大专家,Mistral 3 从 DeepSeek 拿来架构后故意把专家做粗来换取推理吞吐。专家数量不是越多越好,是和部署形态绑定的取舍。

另一个细节:几乎所有 MoE 模型的开头都刻意绕开常规路由。GLM-5、Step 3.5 Flash 的前 3 层是纯稠密 FFN;DeepSeek V4 更有意思,前 3 层用 token id 哈希直接路由的 MoE,连学习出来的路由器都省了。道理是相通的:早期层负责稳定的底层特征,这时候引入路由的不稳定性得不偿失。

残差:25 家 RC,2 家 mHC

表格里最扎眼的差异在残差列。25 个模型用最普通的残差连接(RC),DeepSeek V4 系列换成了 mHC(流形约束超连接)。

故事从 Hyper-Connections(字节,2024)开始:把单一的残差流加宽成 n 路,层与层之间的连接模式变成可学习的混合矩阵,表达力更强。但 HC 的混合矩阵是自由参数,破坏了残差连接的恒等映射性质,深了之后训练发散。

DeepSeek 的 mHC(2025 年 12 月论文)给混合矩阵加了个流形约束:用 Sinkhorn-Knopp 算法迭代约 20 轮,把它投影到双随机矩阵空间(Birkhoff 多面体),恒等映射性质回来了,训练稳了。V4 是 mHC 的第一个前沿规模部署,配置里 hc_mult: 4(4 路残差流)、hc_sinkhorn_iters: 20。论文也坦承新加的稳定机制是经验性发现,没有理论保证——工程先跑通,理论以后补。

激活函数:SwiGLU 的天下,Gemma 的坚持

这一列几乎不需要讨论:SiLU 门控的 SwiGLU 是绝对主流,2026 年唯一还在用 GELU 系(GeGLU)的只有 Gemma 4,从 Gemma 一代传下来的家族传统。效果上两者没有公认的显著差距,属于”没有理由换就没有换”的存量选择。

把表格合上看:三条路线

把 27 行数据放在一起,2026 年的开源模型界大致分成了三个阵营:

DeepSeek 系(压缩注意力):MLA 打底,V3.2 之后叠 DSA/CSA/HCA 做稀疏化,目标是用最小的 KV cache 和计算量扛起百万上下文。用户:GLM-5/5.1、Kimi K2.5/K2.6、Mistral Small 4、Sarvam 105B、Ling 系列(Ling 用 MLA 但配的是 Lightning),以及 DeepSeek V4-Flash(V4-Pro 的逐层配置见上面脚注)。

Qwen 系(线性混合):Gated DeltaNet 与 Gated Attention 按 3:1 混合,赌的是线性注意力终于能扛主力的时刻到了。用户:Qwen3.5/3.6 全系(连 27B dense 版都换了)。

Google 系(经典打磨):GQA + 5:1 SWA + sandwich norm,架构上最保守,靠数据和训练把 31B 稠密模型打出了 397B MoE 的排名(Raschka 引用的 AI Arena 榜单)。另外 Nemotron 的 Mamba 混合、Nanbeige 的全经典配置,说明”不折腾也能活”这条路还在。

把 27 行数据合上再想,最直观的感受是:这些组合真的快被玩完了。Pre-Norm 还是 Post-Norm、MLA 还是 GQA、全注意力还是线性混合,每个位置都有两三个成熟选项,新模型的发布越来越像在菜单里点菜。但反过来想,组合的收敛恰恰说明基础架构不再是瓶颈,2026 年各家真正拉开差距的地方在数据、训练配方和后训练上。架构同质化的下一站是什么?DeepSeek V4 的 mHC 也许是个信号:当纵向的深度和宽度都卷完了,横着加宽残差流成了新的扩展维度。

参考

汇总用的主要来源:

论文(按文中出现顺序):

技术论文
Transformer / MHAAttention Is All You Need
GQAarXiv:2305.13245
MLADeepSeek-V2, arXiv:2405.04434
DeepSeekMoEarXiv:2401.06066
Pre-LN / Post-LNXiong et al., arXiv:2002.04745
OLMo 2(Post-Norm 实践)arXiv:2501.00656
QK-Norm 来源Scaling Vision Transformers, arXiv:2302.05442
RMSNormarXiv:1910.07467
RoPERoFormer, arXiv:2104.09864
NoPEarXiv:2305.19466
YaRN(长度扩展)arXiv:2309.00071
SWA(长文窗口)Longformer, arXiv:2004.05150
Gemma 3(5:1 SWA 实践)arXiv:2503.19786
Gated AttentionarXiv:2505.06708
Gated DeltaNetarXiv:2412.06464
Mamba-2arXiv:2405.21060
Kimi Linear / KDAarXiv:2510.26692
MiniMax-01(Lightning Attention)arXiv:2501.08313
DeepSeek-V3(基线架构)arXiv:2412.19437
DeepSeek-V3.2 / DSAarXiv:2512.02556
DeepSeek-V4 / CSA-HCAarXiv:2606.19348
Hyper-ConnectionsarXiv:2409.19606
mHCarXiv:2512.24880
MTParXiv:2404.19737
GLM-5arXiv:2602.15763
Kimi K2.5arXiv:2602.02276
Step 3.5 FlasharXiv:2602.10604
MiniMax-M2 系列arXiv:2605.26494
Nemotron 3 SuperarXiv:2604.12374
Nemotron 3 NanoarXiv:2512.20848

评论

评论功能已就位但尚未启用:在 src/config.tsgiscus 字段中填入 repo / repoId / category / categoryId(到 giscus.app 用公开 GitHub 仓库生成)后,评论框会自动出现在这里。