返回列表

Ling-3.0-flash:智以密胜

2026年7月24日12 分钟阅读

今天,我们正式发布百灵新一代原生混合推理模型 Ling-3.0-flash。

相比上一代 1T 级旗舰思考模型 Ring-2.6-1T,Ling-3.0-flash 的总参数量为 124B(约为 Ring-2.6-1T 的 12.4%),激活参数量仅为 5.1B(约为 Ring-2.6-1T 的 8.1%),却实现了全方位的能力对标甚至超越。这不仅是一次参数量级的重构,更是一场 paradigm shift(范式转移)——模型获取智能的方式,不追求单纯的规模堆砌,而更关注于对每一寸算力与状态的高效压榨,追求”智能密度”的极致提升。

Ling-3.0-flash 的能力跃迁并非来自参数规模扩张,而源于底层架构升级与 Agent 定向优化的双轮驱动:一方面,原生混合线性注意力、细粒度 KDA 状态记忆与 1/64 稀疏 MoE 协同提升了参数向实际能力的转化效率;另一方面,面向生产力场景的定向打磨强化了模型在复杂规划、多轮工具调用与长程任务交付中的核心战力。在两者的共同作用下,模型以极低体量展现出向更大体量模型对标甚至越级挑战的可能,让高性能与高性价比真正兼得。

具体而言,Ling-3.0-flash 的核心改进体现在如下几个方面:

  • 混合线性架构,原生进化: 从预训练伊始即采用原生混合线性注意力架构(5:1 交替堆叠 KDA 与 MLA),并升级全新 KDA 细粒度对角门控与 1/64 稀疏 MoE。在 124B 总参数、5.1B 激活参数规模下,实现了长上下文效率、状态记忆与计算成本的协同跃升。
  • 极致智能密度,越级挑战: 追求”快、省、可落地”的智能密度与智效比极限,在直面更大尺寸竞对 SOTA 及上一代旗舰时实现性能越级。仅需 5.1B 激活参数即可提供卓越的传统推理、指令遵循与长文本能力,全面赋能复杂 Agent 场景的高效落地。
  • Agent 全面进化,长程闭环: 围绕真实生产力场景深度打磨,扩展 10,000+ 可交互训练环境,实现 Coding、General 与 Deep Research Agent 任务的全程闭环,做到”能力强、响应快、协同稳”。同时创新接入 SGLang HiCache + Mooncake 分级缓存架构(物理双池、集群共享 L3),使长程交互无需重算,长输入下 TTFT 降低 60% 至 80%+。

Ling-3.0 核心能力对比

01 Ling-3.0 架构升级:124B 释放 1T 级能力

Ling-3.0 系列模型在架构设计上实现系统性升级,深度融合长上下文计算、状态记忆与专家路由优化,以更低的单 Token 激活规模承载并转化更大容量的知识与能力。

Hybrid-linear:原生混合线性注意力架构

不同于 Ling-2.6 依赖架构迁移进行预训练改造,Ling-3.0 从预训练伊始即采用原生混合线性注意力架构,以 5:1 的比例交替堆叠 KDA 线性注意力层与 MLA 层(每 6 层包含 5 层 KDA 和 1 层 MLA)。该设计使全链路模型组件在整个训练周期内深度协同优化,在长上下文效率与模型能力之间实现更优平衡。

Ling-3.0 将上一代的 Lightning Attention 升级为 KDA(Kimi Delta Attention)。KDA 在 Delta Rule 的状态更新中引入细粒度对角门控,赋予不同特征通道独立的保留、衰减与写入控制能力。这一机制显著提升了有限状态记忆的控制精度,使模型在处理长文档、大型代码库和复杂资料包时,能够精准维护跨段落、跨步骤的关键信息,为长上下文检索、信息整合和持续推理奠定坚实的架构基础。

基于 Ling Scaling Law,更低的专家激活比例可带来更高的”效率杠杆”,即以更少的实际计算获得更高的等效模型能力。因此,Ling-3.0 将每个 Token 的专家激活比例由前代的 1/32 进一步降低至 1/64,以极低的计算消耗驱动模型能力的跃迁。

综上,原生混合线性注意力、KDA 与稀疏 MoE 三者深度协同,大幅提升了参数规模、计算开销与模型能力之间的转化效率,为 Ling-3.0-flash 在 124B(激活 5.1B)规模下的跨越式发展提供了坚实的架构支撑。

原生混合线性注意力架构示意

以极致智能密度,探索能力边界与落地极限

在上一代 flash 模型对智能密度与智效比极致探索的基础之上,Ling-3.0-flash 持续全面进化。我们不求单纯的”大而全”,而是专注于在”足够强”的前提下,把”快、省、可落地”做到极致,不断突破模型能力的上限与智能密度的绝对边界。面对更大尺寸的 SOTA 模型及上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 在多项关键指标上展现出不逊色甚至更优的越级表现:

核心能力全面对标,性能实现越级。 Ling-3.0-flash 在传统推理、指令遵循与长文本交互上展现出向更大体量模型对比的底气,不仅全面覆盖数学、传统逻辑与代码等核心复杂场景,精准驾驭多约束及智能体环境下的严苛指令,更能从容支撑海量上下文处理,保障长周期、多轮次深度交互中复杂业务逻辑的持续推进。

多场景深度适配,Agent 扎实落地。 围绕当下最炙手可热的 Agent 场景,Ling-3.0-flash 展现出极高的场景契合度,做到”能力强、响应快、协同稳”。无论是深度覆盖代码生成、多文件重构与结果验证的 Coding Agent,具备出色任务规划、工具组合与动态调整能力的 General Agent,还是专注于多轮检索、跨源整合与证据闭环的 Deep Research Agent,模型均能扎实落地,以卓越的闭环执行力从容驾驭各类复杂生产力场景。

极致智能密度,兼顾高性能与高性价比。 在追求高性能的同时,Ling-3.0-flash 在智能密度与智效比的维度上追求极致。凭借极少的总参数与激活参数,模型在多项测评指标中达到或超过大尺寸 SOTA 与上一代旗舰 Ring-2.6-1T,更将推理开销压至极低。这种极致的智能密度转化为实际应用价值,意味着更短的生成时延、更快的首字响应(TTFT)与更低的 API 调用成本,全面赋能高频线上服务与真实 Agent 的落地。

评测默认开启思考模式,计算均分时使用所有模型都有评测得分的部分。

  • 智能密度(IQ/显存成本) = 平均榜单分数 ÷ 总参数量(B),代表”单位显存下的智能水平”,衡量起步部署硬件门槛
  • 智效比(IQ/计算成本) = 平均榜单分数 ÷ 单 token 激活参数量(B),代表”单位计算算力下的智能水平”,衡量高并发服务能力

激活参数决定单次推理计算量与服务吞吐:Ling-3.0-flash 仅需 5.1B 激活参数即可提供具有竞争力的智能分数。

智能密度与评测对比

02 Agent 全面进化:能力强、响应快、协同稳

值得一提的是,Ling-3.0-flash 还围绕真实生产力场景,对 Agent 能力、运行效率与协同架构进行了系统升级。面对复杂约束和长程任务,Ling-3.0-flash 能够持续规划、调用工具、响应环境反馈,并根据中间结果动态调整执行路径,最终完成可验证的任务交付。与此同时,我们通过分级缓存和 Multi-Agent 协同架构,进一步提升了长会话交互效率,以及复杂任务执行的能力上限与稳定性。

能力强:复杂任务,持续优化

在训练方面,我们将 Coding Agent、General Agent 和 Deep Research Agent 的可交互训练环境扩展至 10,000 余个,并持续提升环境的质量、多样性和任务难度。针对长程 Agent 任务,我们在 RL 阶段引入完整执行轨迹复盘和步骤贡献评估机制,为任务执行过程生成更细粒度的步骤级训练信号,帮助模型更高效地从环境交互、失败反馈和自主纠错中学习。

由此,相比上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 的 Agent 能力实现全面提升,在多项指标上对齐甚至超越体量达其 2~3 倍的开源 SOTA 及行业领先闭源模型,展现出面向真实生产力场景的任务执行与交付能力。这种能力也经受住了真实 APP 生成需求场景的检验,Ling-3.0-flash 在 MiniAppBench  上的通过率达到 25.3%,与总参数规模约为其两倍的开源 SOTA 模型达到同等水平。MiniAppBench 要求模型仅根据一句用户需求,生成完整可用的 APP,参与评测的 16 个主流模型平均通过率仅为 17%。

Agent 能力评测对比

响应快:长程交互,无需重算

Agent 任务越复杂,对话轮次越多,上下文也越长。传统推理服务中,一旦本地缓存被新请求挤出,或同一会话被调度至其他计算节点,系统往往需要重新处理前面数万 Token 的上下文,导致首 Token 延迟(TTFT)快速上升。为此,Ling-3.0-flash 基于 SGLang HiCache 与 Mooncake 构建了集群级分层缓存体系,让已有上下文能够跨层级存储、跨节点共享和按需恢复,将缓存从”实例私有”升级为”集群共享”,最大限度减少长上下文的重复计算。实测显示,在长输入场景下,命中 L3 Cache 相比直接重新计算,可将 TTFT 降低 60%~80% 以上

从本地缓存到集群共享,从重复计算到分层复用,Ling-3.0-flash 显著提升了长会话的 Token Efficiency。对于 Coding Agent、长文档问答等需要持续携带完整历史的场景,这意味着更快的任务接续、更低的计算开销,以及更加流畅稳定的交互体验。

Multi-Agent 协同稳:多元智能,相互校验

面对复杂 Agent 任务,传统的 Single-Agent 推理链路容易受到决策漂移、局部误判和容错能力不足等问题影响。为此,Ling-3.0-flash 升级了多智能体协同架构 “Ling Multi-Agent”。我们在 SearchSwam  “委派智能(Delegation Intelligence)“范式的基础上,进一步研究了 Multi-Agent 架构的 Scaling 机制。不同 Agent 可以围绕任务进行多层级分工,并通过交叉验证、信息补充、协同纠错与竞争赛马,降低单一推理路径带来的偏差。

如下图,在 BrowseComp 和 BrowseComp_zh 上,通过”Ling Multi-Agent”架构可获得 log-linear 的性能提升。未来,我们将把这一范式拓展到更广泛的任务场景,持续探索更大规模智能体协同的能力边界。

Ling Multi-Agent 在 BrowseComp 上的性能提升

03 生产力场景:从 Agent 评测到真实系统执行

Ling-3.0-flash 原生支持 256K 上下文,并可扩展至 1M;同时针对 Agent 场景进行了专项优化,使模型能力不止体现在评测指标上,也能更好地转化为真实系统中的任务执行能力。

Blender 自动化建模

Ling-3.0-flash 已经突破了平面代码的限制,可以直接介入 3D 设计世界,成为你随时可调用的虚拟三维建模助理。

在 Blender 使用场景中,Ling-3.0-flash 通过 Blender MCP 接口控制 3D 软件,自动编写 Python 脚本在一句话指令下搭建包含高架路网、摩天大楼与材质的城市场景,最后设置相机路径并渲染输出航拍视频。

在生成过程中,Ling-3.0-flash 体现出了复杂 3D 几何空间推理、Blender Python API 控制以及长程 MCP 工具调用等能力。

自主多智能体科研大盘

拿到一个课题不知从何下手?Ling-3.0-flash 可以扮演多重角色快速进行文献检索、数据质询,并生成论文,合成你需要的 PPT。

Ling-3.0-flash 搭建的自主多智能体科研大盘,支持跨角色(Scientist、Data Analyst、CrossValidator、Archivist、Writer)自主进行假说推演、文献检索、数据质询打回、黄区现场研讨与自动化成果论文及 Slide 报告合成。

办公软件自动化

如果你有一堆凌乱的立项草稿和预算数据需要梳理,不需要手动调格式和套公式,模型能像私人秘书一样帮你完成这些日常核算工作。

面向真实的办公场景,Ling-3.0-flash 能够基于 Office MCP 接口,由 AI 直接读取并排版 Word 提案(调整格式并生成目录),同时核算 Excel 财务数据(处理 SUMIF 公式与透视表汇总),最终输出规范文档与 PDF 滚动长图。

过程中表现出了 Ling-3.0-flash 对多模态文档解析、Office API 精细控制与自动化长程执行的稳定性。

批量美学网页生成

大模型不仅是代码工具,更是设计大师。即使没有任何图片素材,Ling-3.0-flash 只凭代码,就能批量为你搭建出极具视觉冲击力的前卫艺术网页。

Ling-3.0-flash 批量生成了数个现代设计流派页面(含包豪斯、波西米亚、酸性设计等,包含 Easy 到 Hard 渐进难度),在不依赖外部图片的前提下,纯靠 CSS 渐变、SVG 路径和排版布局还原流派质感。

不同风格的页面生成展现出了 Ling-3.0-flash 对视觉流派设计的理解力、极高质量的前端代码批量生成与无图美学排版能力。

网页版黑白极简电子琴与合成器

如果你需要一个多媒体应用来教学或了解,不需要买什么专业软件,可以让 Ling-3.0-flash 给你写一个。

Ling-3.0-flash 开发了一个网页版黑白钢琴电子琴,利用浏览器 Web Audio API 实现多种合成器波形选择与声音包络调校,并配合 Canvas 实时声波可视化动效。

过程中展现出了 Ling-3.0-flash 的代码开发、3D、多媒体生成等综合能力。

根据上下文生成营销文案

如何在已有信息里快速发现关键信息,并生成可对外发布的营销文案?如果你没有精力处理,Ling-3.0-flash 可以帮你针对不同平台的特征快速整理出合适的文案。

房地产销售给运营发邮件,通过接入 Ling-3.0-flash 结合上下文,并快速生成适合 Instagram、X/Twitter、Linkedin 的营销文案。

自动规划课程安排

课程时间安排繁琐而复杂?在没有时间处理的情况下,Ling-3.0-flash 可以像一位私人秘书,帮你实现自动回复与更新课程安排。

Ling-3.0-flash 通过联合 OpenClaw,在收到课程时间询问时,自动查看日历中的课程安排,并自动回复自选的课程时段,同时向咨询者发送确认信息,对日历进行更新。

04 局限性与未来计划

在追求极致智能效率与高性价比落地的同时,基于当前的架构设计与权衡取舍,Ling-3.0-flash 目前也客观存在以下局限性:受限于极致压缩的参数规模,模型的资源倾斜主要聚焦于智能体与核心推理能力,因此在广度知识储备上做了一定妥协。同时,多语言控制仍有提升空间,在长对话或高压交互场景下偶发会出现中英混杂现象。

面向未来,我们将聚焦以下方向持续迭代:通过精细化知识注入与多语言对齐策略进行定向优化,补齐短板;在此基础上,进一步拓宽并深化更复杂的智能体场景,攻克长链条、多步骤的长程任务执行难题,持续探索参数规模下的极致智能效率边界。

05 即刻接入

为方便更多开发者快速体验 Ling-3.0-flash,我们将在 OpenRouter 与百灵官方平台同步开放限时免费 API 调用,免费期截至 8 月 3 日 23:00(北京时间)。

OpenRouter 体验地址: https://openrouter.ai/inclusionai/ling-3.0-flash:free 

Ling-3.0-flash 模型权重将在免费期结束后正式开源,敬请关注。

模型发布技术分享