Skip to Content

Ling

Ling 是蚂蚁集团自主研发并开源的通用大语言模型系列,基于 MoE(混合专家)架构构建,历经国产异构算力平台适配验证、万亿参数规模突破,持续迭代至长上下文建模与 AI Agent 协同推理能力。


为什么选择 Ling?

Ling 系列在推理效率、长上下文建模和训练技术三个维度实现了关键突破:

推理效率

传统 Dense 模型在推理时需激活全量参数,计算开销与模型规模成正比。Ling 采用 MoE 架构,每个 Token 仅路由激活最相关的专家子网络,从而在保持大规模模型容量的同时,将实际计算量压缩至极小比例。

长上下文支持

在 MoE 高效推理基础上,Ling 系列在长序列建模上进一步突破。

  • Ling-3.0-flash:原生支持 256K 上下文窗口,最高支持 1M 上下文窗口。
  • Ling-2.6-1T:最长支持 1M 上下文窗口;官方 API 当前开放 256K 上下文。
  • 长程信息召回无明显衰减:无论目标信息位于上下文头部、中部还是尾部,模型均可稳定检索。

选型指南

以下是 Ling 系列不同尺寸的模型的能力对比,供您评估与选型:

模型定位上下文参数激活参数
Ling-3.0-flash高性价比的混合推理模型,激活参数 5.1B,高 TPS 可支撑高频任务,最高推理速度可达 1000 tokens/s,高速、稳定、成本低256K124B5.1B
Ling-2.6-1T旗舰大模型,支持 1M 上下文长度,打通从逻辑思考到任务落地的全链路1M1T63B

选型建议

  • 对大多数通用场景,推荐从 Ling-3.0-flash 入手,在相同计算资源下效率更高,复杂任务处理更加轻松高效,大幅降低成本。
  • 需要处理超长文档、复杂多跳推理或 Agent 任务链?选择 Ling-2.6-1T,它依托 MLA 与 Linear Attention 的 Hybrid 架构创新,摒弃繁琐的“慢思考”,以“快思考”机制实现高效推断,仅凭极低 Token 开销直达结果,极致压缩输出成本。
  • 对推理延迟与吞吐量敏感的在线服务场景,Ling-3.0-flash 的低激活参数量使其具备更优的 TTFT(首 Token 延迟)与 TPS(每秒 Token 输出)表现。

模型详解

接下来,让我们深入了解每款模型的技术特点与适用场景:

Ling-3.0-flash

  • Ling-3.0-flash 是 Ling 系列最新一代高性价比模型,总参数量 124B,激活参数量 5.1B,原生 256K 上下文窗口,最高可扩展至 1M。
  • 与上一版本的 flash 模型相比,Ling-3.0-flash 在长程任务的稳定性显著增强,工具调用的精确度明显更高,对常见 Harness 环境的适配也有显著提升。在编程任务中,Ling-3.0-flash 对空间的理解能力有很大优化,能够完成物理场景网格和相对位置的构建。同时,得益于混合 Reasoning 模式,对不同难度的任务执行成功率均有提升。

核心优势

  • 高性价比,更低激活,更高吞吐,单位任务下成本更低、效率更高,复杂任务处理更加轻松高效
  • 支持思考和非思考的无缝切换,既可以思考后处理复杂任务,也可以关闭思考后满足大批量生产或低延迟场景
  • 高 TPS 支撑高频任务,最高推理速度可达 1000 tokens/s,TTFT < 100ms,同样单位时间内可以多看、多查、多想,迭代次数更多,结果更准确
  • 工具调用稳定。RL 强检查机制下,长程工具调用稳定性显著提升,指令遵循可靠
  • 原生 256K 上下文窗口,最高可扩展至 1M,具备完整的工具调用与 Agent 能力

应用场景

  • 办公自动化、办公协作与 Cowork
  • 人机协同:在人类指示下,敏捷高效地进行日常代码开发任务。
  • 高并发的大批量数据处理与分析场景,如简历筛选、文档审查、知识库整理、数据清洗
  • 对响应速度有较高要求的数字人直播实时响应、流媒体互动、实时翻译等场景

Ling-2.6-1T

Ling-2.6-1T 是 Ling 系列最新一代旗舰大模型,采用 MLA 与 Linear Attention 的 Hybrid 架构,总参数量约 1T,激活参数量约 63B,支持 1M 超长上下文,在旗舰智能与 Token 效率之间实现强平衡

核心优势

  • 以「快思考」替代冗长思考链,在更低 Token 开销下保持万亿参数的智能。
  • 强化编码和 Agent 的能力,在 AIME26、SWE-bench Verified 等执行类基准上达到开源 SOTA。
  • 与 Claude Code、OpenCode、OpenClaw 等主流 Agent 框架高度兼容,适配多工具、多步骤、多约束场景。

应用场景

  • 多步任务和智能体协作
  • 代码补全、项目交付和缺陷修复
  • PPT、报表等数据可视化项目
  • 长上下文的知识管理和自动化办公交付

Ling 的演进历程

Ling 系列经历了从算力适配验证到 Agent 能力突破的完整技术演进:

时间版本关键技术突破
2025.03Ling 1.0 系列验证 MoE 大语言模型在非高端异构算力平台(非 A100/H100)上的工程可行性,完成国产算力适配
2025.10Ling 2.0 系列首次突破万亿参数规模,引入 FP8 端到端训练,显著提升训练效率并实现跨领域泛化能力
2026.02Ling 2.5 系列实现高吞吐解码优化,长上下文理解能力达到业界领先水平,初步构建 Agent 交互与工具调用基础能力
2026.04Ling 2.6 系列打通逻辑推理至任务执行的完整推理链路,大幅提升”智效比”(单位计算成本下的任务完成能力),开启高性价比可规模化 Agent 时代
2026.07Ling 3.0 系列从迁移式混合线性架构走向原生混合线性设计,以更低的专家激活比例提升模型容量与计算的转化效率,并引入 KDA(Kimi Delta Attention),增强长序列中的记忆更新与信息保留能力。

技术生态

基于 Ling 基座模型,我们构建了覆盖训练到部署全链路的技术生态:

  • 高性能算子库:开源的高性能训练与推理算子系统,涵盖 MoE 路由、注意力计算等核心组件,支撑从预训练到在线推理的全链路优化。
  • 垂直领域专用模型:面向医疗、金融等专业场景的领域适配模型,在领域知识密集型任务上表现更优。
  • 开源社区:全部研究成果开源至 Inclusion AI  社区,持续与开发者共建生态。

快速开始

  1. 获取 API 密钥:获取访问凭证。
  2. 完成首次调用:5 分钟完成第一个 API 请求。
  3. 探索更多能力:深入了解推理优化、长上下文等高级特性。
这个页面对你有帮助吗?
Last updated on