AI · Industry 2026 年 07 月 17 日 约 12 分钟阅读

万亿参数模型退潮之后,行业向什么方向演化

从 Scaling Law 失灵、MoE 稀疏化崛起,到端侧小模型与 Multi-Agent 工程化—— 大模型行业的下半场,不再是参数的军备竞赛,而是架构、场景与系统协同的深水区。

金楷然
金楷然 · Kairan Jin
USTC · AI 算法研究 · 大模型 & Agent 工程
TL;DR
当算力军备竞赛的狂热退去,万亿参数模型正从行业信仰跌落为商业负资产。 Scaling Law 失灵 + 商业 ROI 严苛审视宣告了单纯堆算力路线的破产; MoE 稀疏化通过"按需调用"机制在保持表征能力的同时大幅削减推理成本; 小模型 + RAG + 端侧算力在真实场景中完成对大模型的降维打击; Agent 工作流与多模型协作正以工程复杂度置换算力规模。 下半场,属于架构创新、端侧落地与系统协同的工程化时代。

01万亿参数退潮:算力崇拜的终结

当算力军备竞赛的狂热退去,万亿参数模型正从行业信仰跌落为商业负资产。曾经,参数规模被视作衡量智能涌现的唯一标尺,但如今这条粗暴的扩张路线正遭遇物理规律与商业逻辑的双重审判。从狂热到遇冷,并非大模型技术本身的停滞,而是行业对边际收益递减规律的迟钝反应终于迎来了清算。

Scaling Law 的失灵,宣告了暴力美学时代的终结。在 2019 至 2021 年的狂飙期,前沿模型的参数规模曾实现超过 100 倍的爆发式增长,仿佛只要堆够算力,通用人工智能就能自然降临1。然而,自 2021 年以来,前沿模型的参数规模年增长率已断崖式暴跌至仅约 5%1。这种近乎停滞的增长并非厂商克制,而是数据枯竭与质量天花板的双重阻击。高质量人类语料被吞噬殆尽,万亿参数模型在低质量数据上反复咀嚼,导致模型性能提升彻底脱离了线性增长轨道。没有高质量数据作为燃料,再庞大的参数引擎也只能空转。

算力账本下的商业溃败,则是对万亿参数路线最致命的一击。训练一次万亿参数模型动辄耗费千万美元,而推理成本更是随参数规模呈指数级飙升。当企业试图将其推向落地时,却发现性能的微弱提升根本无法覆盖天价的算力开销。正如东吴证券研报所指出的,当前大模型产业正处于企业逐渐实现 ROI 验证的关键发展阶段2。在严苛的 ROI 审视下,万亿参数模型高昂的训练与推理成本,与其实际带来的微弱增量形成了巨大剪刀差。这种商业逻辑上的难以为继,直接宣告了单纯堆算力拼参数路线的破产,倒逼行业将目光转向更具性价比的轻量化架构。


02架构突围:MoE 与稀疏化的崛起

当万亿参数稠密模型的推理算力与商业回报彻底失衡,架构层面的突围便不再是选修课,而是生死局。大语言模型的性能与参数量之间虽存在近似的幂律关系,但传统 Dense 模型面临一个根本矛盾:参数量增长带来能力提升的同时,推理计算量也呈线性增长,GPT-4 级别的 Dense 模型每次推理都在燃烧不菲的算力账单3。混合专家(MoE)架构正是打破这一算力诅咒的利器,它让模型在保持庞大参数规模带来的表征能力的同时,大幅削减实际推理消耗。

MoE 架构的降本增效,核心在于将"全员参与"的稠密计算转变为"按需调用"的稀疏激活。传统模型每次前向传播都需要激活所有参数,而 MoE 通过动态路由机制,每次只调用一小部分最相关的"专家"子网络进行计算5。以 DeepSeek 模型为例,其动态专家选择机制使得实际激活的参数量仅占总参数的 13%–25%,这意味着超过七成的参数在单次推理中处于休眠状态6。这种机制直接带来了显存占用的大幅降低和推理速度的显著提升,在相同硬件配置下,模型以更少的计算量输出了比肩甚至超越大参数稠密模型的结果7

然而,稀疏激活在算力账本上的优美,并不能掩盖其在工程落地时的骨感。MoE 架构最大的梦魇在于负载不均衡——如果路由机制倾向于将大部分 Token 分配给少数"热门专家",不仅会导致显存与计算资源的严重浪费,还会引发严重的通信瓶颈3。为了攻克这一挑战,DeepSeek 引入了共享专家隔离机制与细粒度专家分割,前者强制分流基础通用知识计算,后者则提升了任务适配的精度6。此外,Mamba 作者团队提出的 SonicMoE,通过一个 Token 舍入机制,让 MoE 的训练速度提升了近 2 倍8

架构创新的最终价值,必须由实战性能来裁决。近期 MoE 模型展现出明显的高专家粒度与高稀疏性趋势,即在专家总数增加的情况下保持激活专家数不变,这显著提升了单位 FLOPs 的模型质量8。DeepSeek V3、Kimi K2 等开源模型正是这一趋势的受益者,它们以远低于万亿参数稠密模型的算力成本,打出了极具竞争力的表现。英伟达 2024 年 2 月的数据显示,其数据中心推理收入占比已达 40%,算力消耗正不可逆地向推理端倾斜9


03小模型狂飙:端侧与垂直场景的胜利

当万亿参数的泡沫退去,小模型正凭借 RAG、垂直微调与端侧算力,在真实商业场景中完成对大模型的降维打击。

万亿参数模型曾试图把全人类知识塞进黑盒,但巨额推理成本与严重的知识幻觉让这种"死记硬背"走向死胡同。RAG(检索增强生成)技术的成熟,彻底改变了游戏规则——小模型不再需要靠堆参数来硬记知识,而是将能力重心转向逻辑推理。北京大学的研究证实,在数智校园网络服务问答场景中,融合知识库与 RAG 的复合架构,其表现全面碾压仅依赖基础大模型的架构10。通过外挂非结构化文本与知识图谱,小模型无需万亿参数也能拥有广博且精准的行业知识。这标志着 AI 应用的护城河正从底层基座转向 RAG 与 Agent 工作流,知识的时效性与准确性被重新交还给检索系统,模型本身只需专注"想明白"而非"背下来"。

通用大模型什么都知道一点,但在垂直领域往往什么都做不深。当 AI 应用大规模落地,企业真正需要的不是全能闲聊机器人,而是能解决具体业务问题的专家。面壁智能推出的 MiniCPM-V 4.6 正是这一趋势的缩影,仅 1B 参数的多模态小模型却能卷出新高度,靠的正是对场景的极致聚焦11。行业早已发现,Scaling Law 带来的边际收益在千亿级别后已呈现断崖式下跌,大模型巨额推理成本、不可控的网络延迟与严苛的数据隐私风险,构成了落地时难以逾越的"不可能三角"。相比之下,10B 以下的垂直小模型通过微调,在特定任务上不仅跑得更快,业务 ROI 更是直接碾压了笨重的通用巨兽。

端侧算力的觉醒,则为小模型的狂飙提供了最后的硬件拼图。2026 年上半年,端侧大模型走到了一个新分水岭:光靠压缩已经不够,模型必须原生变轻。6 月 9 日的苹果 WWDC2026 上,苹果发力端侧大模型发布了 AFM3 系列,彻底吹响了硬件厂商抢夺本地 AI 的号角12。创业公司创始机器学习工程师 Vicki Boykis 也观察到,本地运行 AI 模型在最近半年实现了性能跨越,智力与 Agent 工具链成熟度大幅提升,如今已经能做到"点两下就能跑"13。在低延迟、隐私保护与离线场景下,端侧小模型具有云端大模型不可替代的绝对优势。当推理不再依赖云端,小模型便真正完成了对大模型的降维打击。


04系统级进化:从拼参数到拼工程

当参数规模的军备竞赛触及 ROI 天花板,大模型行业的竞争焦点已不可逆地从底层基座转向了系统级工程能力。2021 年以来前沿模型参数规模年增长率已骤降至 5%1,单纯堆算力的边际收益断崖式下跌,逼迫玩家在架构与调度中寻找新增长极。

AI 应用的护城河不再是基座模型本身,而是通过 Agent 编排工具、规划任务、自我反思所构建的业务工作流。智能体工作流(Agentic AI Workflows, AAW)定义了智能体如何执行功能,包括检索合适的工具、管理内存、制订任务计划以及调用 API 完成特定任务14。与传统工作流不同,AAW 能够处理非确定性任务并动态生成流程,这意味着 AI 不再是被动响应的工具,而是具备自我规划与反思能力的业务引擎。当任务复杂到单次对话无法搞定时,通过 Subagent 模式将大任务拆解为多个子任务并行执行,已成为工程界的标准解法15

然而,单体智能体的能力终究存在边界,难以兼顾多领域、多维度的复杂工作,系统级进化的下一步必然是多模型协作。单一 AI Agent 如同单个职场员工,而多智能体系统由多个功能差异化的 AI Agent 组成,通过分工协作、信息互通与协同决策,完成超复杂任务,被视为 AI 智能化升级的终极形态之一16。这并非简单的并行调用,而是深度的流程咬合——就像一个团队,有人负责研究,有人负责写代码,有人负责审核发布17。一旦让多个 AI 智能体配合完成有前后依赖关系的任务,系统复杂度会跳到完全不同的量级,其中最直接的挑战就是谁能看到谁的信息,以及如何避免协作死锁18

通过路由调度多个垂类小模型协同工作,系统级架构正涌现出超越单一万亿参数模型的能力。这种架构的实质,是用工程复杂度置换算力规模。基于 Deep Agents 工作流等多 Agent 协作模式的实践表明,通过精细化的角色分配与信息流转机制,多模型系统能以极低的算力成本实现业务闭环19。拼参数的时代已经落幕,拼工程与系统协同的下半场刚刚开局。


05结论与展望

核心结论
  1. 万亿参数规模扩张遭遇物理与商业双重天花板:高质量数据枯竭导致 Scaling Law 失灵,高昂的算力开销与微弱的性能提升形成巨大剪刀差,单纯堆砌算力的路线已破产。
  2. MoE 与稀疏化架构成为算力诅咒的破局关键:通过稀疏激活与动态路由,MoE 在保持参数表征能力的同时大幅削减推理成本,并逐步克服负载不均等工程挑战,成为主流架构选择。
  3. 小模型在垂直场景与端侧实现降维打击:借助 RAG 技术释放逻辑推理潜力,结合垂直微调与端侧算力觉醒,小模型以极高的业务 ROI 和低延迟隐私优势,碾压了通用大模型。
  4. 系统级工程能力取代单点参数成为新护城河:从单体 Agent 走向多智能体协作,行业正以工程复杂度置换算力规模,通过精细调度实现业务闭环。

未来展望

大模型行业的演进正从"大力出奇迹"的单体智能,走向"分工与协同"的系统智能。未来,我们将看到更多像 MoE 这样的稀疏化架构与端侧原生小模型深度融合,形成云边端协同的算力网络;多智能体系统将从简单的任务拆解走向具备自我演进能力的复杂组织形态,AI 的壁垒将彻底脱离参数规模的比拼,转向由数据飞轮、业务工作流与工程调度能力共同构筑的深水区。在这个新范式下,谁能以最低的算力消耗实现最精准的业务闭环,谁就能占据下一代 AI 产业的制高点。

参考文献

  1. Omdia:「小型」模型加速规模化扩张 · 腾讯新闻 · 2026-04-30
  2. 计算机行业深度报告:解析大模型行业——从发展历程到投资视角 · 证券之星 · 2026-06-18
  3. MoE 混合专家模型:稀疏激活的架构原理与负载均衡挑战 · CSDN · 2026-06-30
  4. MoE(混合专家)模型 · CSDN · 2026-06-30
  5. DeepSeek 混合专家系统解析:为何效率更高? · 侠游戏网 · 2026-06-30
  6. 深度解析 DeepSeek 的混合专家系统:为什么效率更高? · php 中文网 · 2026-06-30
  7. DeepSeek 混合专家系统原理详解 · 游乐网 · 2026-06-30
  8. Mamba 作者团队提出 SonicMoE:一个 Token 舍入,让 MoE 训练速度提升近 2 倍 · 黄大年茶思屋 · 2026-06-30
  9. 人工智能行业专题(14):大模型发展趋势复盘与展望 · 2024-02-01
  10. 大模型+知识库+RAG 在数智校园网络中的应用研究 · 北京大学机构知识库 · 2026-07-12
  11. 一张 4090 就能爆改!面壁智能 MiniCPM-V 4.6,1B 多模态卷出新高度 · 网易 · 2026-05-13
  12. 2026「端侧 AI 战事」升级,苹果谷歌们在拼什么? · ByDrug · 2026-06-22
  13. 端侧跑大模型,现在也太简单了 · 网易新闻 · 2026-06-24
  14. 智能体工作流是什么? · 腾讯新闻 · 2025-07-19
  15. AI Agent 工作流编排:用 Subagent 实现复杂任务分解 · 博客园 · 2025-07-19
  16. 多智能体系统:不止单一 AI,读懂协同 AI 的未来形态 · CFANZ · 2026-06-30
  17. 【AI Agent 从入门到精通】第六章:多智能体系统架构详解 · CSDN · 2026-06-30
  18. 从单兵作战到团队协作:Octo 让多个 AI 智能体真正配合工作 · 掘金 · 2026-07-06
  19. Deep Agents 工作流 —— 多 Agent 协作模式 · 掘金 · 2026-04-09
— 完 —
← 回到文章列表