Ling
Ling 是蚂蚁集团自主研发并开源的通用大语言模型系列,基于 MoE(混合专家)架构构建,历经国产异构算力平台适配验证、万亿参数规模突破,持续迭代至长上下文建模、多模态理解与 AI Agent 协同推理能力。
为什么选择 Ling?
Ling 系列在推理效率、长上下文建模、多模态理解和训练技术四个维度实现了关键突破:
推理效率
传统 Dense 模型在推理时需激活全量参数,计算开销与模型规模成正比。Ling 采用 MoE 架构,每个 Token 仅路由激活最相关的专家子网络,从而在保持大规模模型容量的同时,将实际计算量压缩至极小比例。
长上下文支持
在 MoE 高效推理基础上,Ling 系列在长序列建模上进一步突破。
- Ling-3.0-flash:原生支持 256K 上下文窗口,最高支持 1M 上下文窗口。
- Ling-2.6-1T:最长支持 1M 上下文窗口;官方 API 当前开放 256K 上下文。
- 长程信息召回无明显衰减:无论目标信息位于上下文头部、中部还是尾部,模型均可稳定检索。
原生多模态理解
Ling 系列首个原生多模态模型 Ling-3.0-flash-VL 现已发布并开源,将视觉理解能力深度融入 MoE 架构:
- 原生支持图像、文本与视频输入:不仅限于”看图说话”,而是将多模态信息作为推理的基础输入,实现更深层的跨模态理解。
- 视觉反馈闭环机制:将任务推进为”观察 → 行动 → 验证 → 修正”的持续闭环,使模型在医疗报告解读、前端代码生成及 GUI 自动化等场景中,能够基于视觉反馈持续修正执行结果。
选型指南
以下是 Ling 系列不同尺寸的模型的能力对比,供您评估与选型:
| 模型 | 定位 | 上下文 | 参数 | 激活参数 |
|---|---|---|---|---|
| Ling-3.0-flash-VL | 原生多模态混合推理模型,支持图像、文本与视频输入,引入视觉反馈闭环,适合多模态理解与生成场景 | 256K | 124B | 5.5B |
| Ling-3.0-flash | 高性价比的混合推理模型,激活参数 5.1B,高 TPS 可支撑高频任务,最高推理速度可达 1000 tokens/s,高速、稳定、成本低 | 256K | 124B | 5.1B |
| Ling-3.0-tiny | 轻量级混合推理模型,激活参数仅 1.3B,支持端侧部署与本地离线运行,低时延、低成本,兼顾实时交互与工具调用 | — | 7.9B | 1.3B |
| Ling-2.6-1T | 旗舰大模型,支持 1M 上下文长度,打通从逻辑思考到任务落地的全链路 | 1M | 1T | 63B |
选型建议:
- 对大多数通用文本场景,推荐从 Ling-3.0-flash 入手,在相同计算资源下效率更高,复杂任务处理更加轻松高效,大幅降低成本。
- 需要处理图片、视频等多模态内容,或构建视觉相关的自动化工作流?选择 Ling-3.0-flash-VL,原生支持图像、文本与视频输入,并通过视觉反馈闭环持续修正执行结果,适合图片转网页、GUI 自动化等场景。
- 需要处理超长文档、复杂多跳推理或 Agent 任务链?选择 Ling-2.6-1T,它依托 MLA 与 Linear Attention 的 Hybrid 架构创新,摒弃繁琐的“慢思考”,以“快思考”机制实现高效推断,仅凭极低 Token 开销直达结果,极致压缩输出成本。
- 对推理延迟与吞吐量敏感的在线服务场景,Ling-3.0-flash 的低激活参数量使其具备更优的 TTFT(首 Token 延迟)与 TPS(每秒 Token 输出)表现。
- 需要端侧部署、本地离线运行或对成本与资源极度敏感的场景?选择 Ling-3.0-tiny,仅 1.3B 激活参数即可胜任实时交互、轻量代码助手、本地知识库检索与工具调用等任务。
模型详解
接下来,让我们深入了解每款模型的技术特点与适用场景:
Ling-3.0-flash-VL
Ling-3.0-flash-VL 是百灵系列首个原生多模态大模型,基于 Ling-3.0-flash 的 MoE(混合专家)架构拓展而来。总参数量 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口 256K Token。目前模型已在 Hugging Face 及 ModelScope 平台开源。
核心优势:
- 原生多模态理解:从架构层面原生融合视觉与语言能力,支持图像、文本与视频输入,不依赖外挂视觉模块
- 视觉反馈闭环机制:引入”观察 → 行动 → 验证 → 修正”的持续闭环,使模型能够基于视觉反馈持续修正执行结果,大幅提升任务可靠性与准确性。不同于一次性的”看图生成”,该机制可在医疗报告解读、前端代码生成及 GUI 自动化等场景中将一次性”生成”转变为具备自我纠错能力的动态过程
- 任意分辨率视觉编码器:引入任意分辨率视觉编码器与 VideoRoPE,在实时视频对话、多轮视觉交互及长时任务中保持低延迟响应
- 架构深度协同:语言主干沿用 42 层混合架构(KDA 与 Gated MLA 按 5:1 比例交替排列),在 124B 总参数下单次推理仅激活 5.5B 参数,兼顾高性能与高性价比
- 256K 上下文窗口:支持长文档与长视频分析,满足长上下文场景需求
应用场景:
- 视觉反馈编程:从截图或参考图中理解布局与组件关系并生成前端代码,能通过渲染结果对比进行自我修正,生成高度还原的网页。
- GUI 自动化:作为 GUI Agent,可识别界面结构并完成跨工具操作,轻松驾驭各类生产力场景
- 专业报告解读:该模型具备医学专业力,同时支持跨文档、跨图文的数据整合与风险标识,适用于专业领域文档分析,如体检报告解读等。
- 实时视频学习与讲解:强化了学科知识和视觉推理能力,可实现拍学、实时视频讲解、视频知识提取等场景,打造可以边看边问的学习伙伴。该场景也已经在「灵光」App 中为用户提供服务。
- 多模态办公自动化:配合 MCP 接口完成涉及图像、文档、视频的综合办公任务
Ling-3.0-flash
- Ling-3.0-flash 是 Ling 系列最新一代高性价比模型,总参数量 124B,激活参数量 5.1B,原生 256K 上下文窗口,最高可扩展至 1M。
- 与上一版本的 flash 模型相比,Ling-3.0-flash 在长程任务的稳定性显著增强,工具调用的精确度明显更高,对常见 Harness 环境的适配也有显著提升。在编程任务中,Ling-3.0-flash 对空间的理解能力有很大优化,能够完成物理场景网格和相对位置的构建。同时,得益于混合 Reasoning 模式,对不同难度的任务执行成功率均有提升。
核心优势:
- 高性价比,更低激活,更高吞吐,单位任务下成本更低、效率更高,复杂任务处理更加轻松高效
- 支持思考和非思考的无缝切换,既可以思考后处理复杂任务,也可以关闭思考后满足大批量生产或低延迟场景
- 高 TPS 支撑高频任务,最高推理速度可达 1000 tokens/s,TTFT < 100ms,同样单位时间内可以多看、多查、多想,迭代次数更多,结果更准确
- 工具调用稳定。RL 强检查机制下,长程工具调用稳定性显著提升,指令遵循可靠
- 原生 256K 上下文窗口,最高可扩展至 1M,具备完整的工具调用与 Agent 能力
应用场景:
- 办公自动化、办公协作与 Cowork
- 人机协同:在人类指示下,敏捷高效地进行日常代码开发任务。
- 高并发的大批量数据处理与分析场景,如简历筛选、文档审查、知识库整理、数据清洗
- 对响应速度有较高要求的数字人直播实时响应、流媒体互动、实时翻译等场景
Ling-3.0-tiny
- Ling-3.0-tiny 是 Ling 系列面向轻量部署场景的混合推理模型,总参数量 7.9B,激活参数量仅 1.3B,支持端侧部署与本地离线运行,模型后续将开源。
- 以极少的激活参数实现真实任务执行能力,兼具数学推理、指令遵循与低幻觉优势,在科学推理、代码、真实任务和长上下文等多个方向上取得均衡表现。
核心优势:
- 极致轻量:仅 1.3B 激活参数,可部署于端侧设备与资源受限环境,推理时延低、算力开销小
- 能力覆盖完整:在数学推理、指令遵循、代码生成与工具调用等方向均具备实用水平,不因”小”而降低对能力的期待
- 原生支持工具调用(Tool-Use),可胜任移动设备与浏览器 UI 自动化等轻量级自动化场景
- 支持本地离线运行,适合对数据隐私敏感、不希望数据离端的私有化部署场景
应用场景:
- 端侧应用与本地离线推理,如本地知识库检索与内容生成
- 轻量代码助手、本地网页翻译等高频低延迟任务
- 企业私有化部署中的任务智能体与垂直场景模型底座
- 工具调用与 UI 自动化交互等实时控制场景
Ling-2.6-1T
Ling-2.6-1T 是 Ling 系列最新一代旗舰大模型,采用 MLA 与 Linear Attention 的 Hybrid 架构,总参数量约 1T,激活参数量约 63B,支持 1M 超长上下文,在旗舰智能与 Token 效率之间实现强平衡。
核心优势:
- 以「快思考」替代冗长思考链,在更低 Token 开销下保持万亿参数的智能。
- 强化编码和 Agent 的能力,在 AIME26、SWE-bench Verified 等执行类基准上达到开源 SOTA。
- 与 Claude Code、OpenCode、OpenClaw 等主流 Agent 框架高度兼容,适配多工具、多步骤、多约束场景。
应用场景:
- 多步任务和智能体协作
- 代码补全、项目交付和缺陷修复
- PPT、报表等数据可视化项目
- 长上下文的知识管理和自动化办公交付
Ling 的演进历程
Ling 系列经历了从算力适配验证到 Agent 能力突破的完整技术演进:
| 时间 | 版本 | 关键技术突破 |
|---|---|---|
| 2025.03 | Ling 1.0 系列 | 验证 MoE 大语言模型在非高端异构算力平台(非 A100/H100)上的工程可行性,完成国产算力适配 |
| 2025.10 | Ling 2.0 系列 | 首次突破万亿参数规模,引入 FP8 端到端训练,显著提升训练效率并实现跨领域泛化能力 |
| 2026.02 | Ling 2.5 系列 | 实现高吞吐解码优化,长上下文理解能力达到业界领先水平,初步构建 Agent 交互与工具调用基础能力 |
| 2026.04 | Ling 2.6 系列 | 打通逻辑推理至任务执行的完整推理链路,大幅提升”智效比”(单位计算成本下的任务完成能力),开启高性价比可规模化 Agent 时代 |
| 2026.07 | Ling 3.0 系列 | 从迁移式混合线性架构走向原生混合线性设计,以更低的专家激活比例提升模型容量与计算的转化效率,并引入 KDA(Kimi Delta Attention),增强长序列中的记忆更新与信息保留能力。 |
技术生态
基于 Ling 基座模型,我们构建了覆盖训练到部署全链路的技术生态:
- 高性能算子库:开源的高性能训练与推理算子系统,涵盖 MoE 路由、注意力计算等核心组件,支撑从预训练到在线推理的全链路优化。
- 垂直领域专用模型:面向医疗、金融等专业场景的领域适配模型,在领域知识密集型任务上表现更优。
- 开源社区:全部研究成果开源至 Inclusion AI 社区,持续与开发者共建生态。