Ling
Ling 是蚂蚁集团自主研发并开源的通用大语言模型系列,基于 MoE(混合专家)架构构建,历经国产异构算力平台适配验证、万亿参数规模突破,持续迭代至长上下文建模与 AI Agent 协同推理能力。
为什么选择 Ling?
Ling 系列在推理效率、长上下文建模和训练技术三个维度实现了关键突破:
推理效率
传统 Dense 模型在推理时需激活全量参数,计算开销与模型规模成正比。Ling 采用 MoE 架构,每个 Token 仅路由激活最相关的专家子网络,从而在保持大规模模型容量的同时,将实际计算量压缩至极小比例。
长上下文支持
在 MoE 高效推理基础上,Ling 系列在长序列建模上进一步突破。
- Ling-3.0-flash:原生支持 256K 上下文窗口,最高支持 1M 上下文窗口。
- Ling-2.6-1T:最长支持 1M 上下文窗口;官方 API 当前开放 256K 上下文。
- 长程信息召回无明显衰减:无论目标信息位于上下文头部、中部还是尾部,模型均可稳定检索。
选型指南
以下是 Ling 系列不同尺寸的模型的能力对比,供您评估与选型:
| 模型 | 定位 | 上下文 | 参数 | 激活参数 |
|---|---|---|---|---|
| Ling-3.0-flash | 高性价比的混合推理模型,激活参数 5.1B,高 TPS 可支撑高频任务,最高推理速度可达 1000 tokens/s,高速、稳定、成本低 | 256K | 124B | 5.1B |
| Ling-2.6-1T | 旗舰大模型,支持 1M 上下文长度,打通从逻辑思考到任务落地的全链路 | 1M | 1T | 63B |
选型建议:
- 对大多数通用场景,推荐从 Ling-3.0-flash 入手,在相同计算资源下效率更高,复杂任务处理更加轻松高效,大幅降低成本。
- 需要处理超长文档、复杂多跳推理或 Agent 任务链?选择 Ling-2.6-1T,它依托 MLA 与 Linear Attention 的 Hybrid 架构创新,摒弃繁琐的“慢思考”,以“快思考”机制实现高效推断,仅凭极低 Token 开销直达结果,极致压缩输出成本。
- 对推理延迟与吞吐量敏感的在线服务场景,Ling-3.0-flash 的低激活参数量使其具备更优的 TTFT(首 Token 延迟)与 TPS(每秒 Token 输出)表现。
模型详解
接下来,让我们深入了解每款模型的技术特点与适用场景:
Ling-3.0-flash
- Ling-3.0-flash 是 Ling 系列最新一代高性价比模型,总参数量 124B,激活参数量 5.1B,原生 256K 上下文窗口,最高可扩展至 1M。
- 与上一版本的 flash 模型相比,Ling-3.0-flash 在长程任务的稳定性显著增强,工具调用的精确度明显更高,对常见 Harness 环境的适配也有显著提升。在编程任务中,Ling-3.0-flash 对空间的理解能力有很大优化,能够完成物理场景网格和相对位置的构建。同时,得益于混合 Reasoning 模式,对不同难度的任务执行成功率均有提升。
核心优势:
- 高性价比,更低激活,更高吞吐,单位任务下成本更低、效率更高,复杂任务处理更加轻松高效
- 支持思考和非思考的无缝切换,既可以思考后处理复杂任务,也可以关闭思考后满足大批量生产或低延迟场景
- 高 TPS 支撑高频任务,最高推理速度可达 1000 tokens/s,TTFT < 100ms,同样单位时间内可以多看、多查、多想,迭代次数更多,结果更准确
- 工具调用稳定。RL 强检查机制下,长程工具调用稳定性显著提升,指令遵循可靠
- 原生 256K 上下文窗口,最高可扩展至 1M,具备完整的工具调用与 Agent 能力
应用场景:
- 办公自动化、办公协作与 Cowork
- 人机协同:在人类指示下,敏捷高效地进行日常代码开发任务。
- 高并发的大批量数据处理与分析场景,如简历筛选、文档审查、知识库整理、数据清洗
- 对响应速度有较高要求的数字人直播实时响应、流媒体互动、实时翻译等场景
Ling-2.6-1T
Ling-2.6-1T 是 Ling 系列最新一代旗舰大模型,采用 MLA 与 Linear Attention 的 Hybrid 架构,总参数量约 1T,激活参数量约 63B,支持 1M 超长上下文,在旗舰智能与 Token 效率之间实现强平衡。
核心优势:
- 以「快思考」替代冗长思考链,在更低 Token 开销下保持万亿参数的智能。
- 强化编码和 Agent 的能力,在 AIME26、SWE-bench Verified 等执行类基准上达到开源 SOTA。
- 与 Claude Code、OpenCode、OpenClaw 等主流 Agent 框架高度兼容,适配多工具、多步骤、多约束场景。
应用场景:
- 多步任务和智能体协作
- 代码补全、项目交付和缺陷修复
- PPT、报表等数据可视化项目
- 长上下文的知识管理和自动化办公交付
Ling 的演进历程
Ling 系列经历了从算力适配验证到 Agent 能力突破的完整技术演进:
| 时间 | 版本 | 关键技术突破 |
|---|---|---|
| 2025.03 | Ling 1.0 系列 | 验证 MoE 大语言模型在非高端异构算力平台(非 A100/H100)上的工程可行性,完成国产算力适配 |
| 2025.10 | Ling 2.0 系列 | 首次突破万亿参数规模,引入 FP8 端到端训练,显著提升训练效率并实现跨领域泛化能力 |
| 2026.02 | Ling 2.5 系列 | 实现高吞吐解码优化,长上下文理解能力达到业界领先水平,初步构建 Agent 交互与工具调用基础能力 |
| 2026.04 | Ling 2.6 系列 | 打通逻辑推理至任务执行的完整推理链路,大幅提升”智效比”(单位计算成本下的任务完成能力),开启高性价比可规模化 Agent 时代 |
| 2026.07 | Ling 3.0 系列 | 从迁移式混合线性架构走向原生混合线性设计,以更低的专家激活比例提升模型容量与计算的转化效率,并引入 KDA(Kimi Delta Attention),增强长序列中的记忆更新与信息保留能力。 |
技术生态
基于 Ling 基座模型,我们构建了覆盖训练到部署全链路的技术生态:
- 高性能算子库:开源的高性能训练与推理算子系统,涵盖 MoE 路由、注意力计算等核心组件,支撑从预训练到在线推理的全链路优化。
- 垂直领域专用模型:面向医疗、金融等专业场景的领域适配模型,在领域知识密集型任务上表现更优。
- 开源社区:全部研究成果开源至 Inclusion AI 社区,持续与开发者共建生态。
快速开始
这个页面对你有帮助吗?
Last updated on