Kimi K3 是 Kimi 迄今能力最强的旗舰模型,拥有 2.8 万亿参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
供应商
Kimi K2.7 Code 是 Kimi 迄今最智能的 Coding 模型,在长上下文中更可靠地遵循指令,能以更高的成功率完成编程任务,同时支持文本、图片与视频输入,思考模式,对话与 Agent 任务。
供应商
GLM-5.2 是面向长任务时代的旗舰模型。支持真正可用的 1M 上下文,实测可承载项目级工程上下文,长程任务执行更稳定、工程规范遵循更可靠,开发场景成功率进一步提升。一次任务即可完成“从需求到多端可部署产物”的完整开发链路。
供应商
MiniMax-M3 是 MiniMax 推出的多模态基础模型。它支持文本、图像和视频输入,并输出文本,拥有 1M 的上下文窗口,适用于长时间的智能体工作、编码和工具使用。该模型基于 MiniMax 稀疏注意力机制 (MSA) 构建,MSA 用键值块选择取代了完整的注意力机制,从而在长时间上下文中大幅降低每个词元的计算量——在 1M 个token的情况下,其计算成本约为上一代模型的 1/20,同时显著加快了预填充和解码速度,并在大多数任务中保持了质量。 该模型在交错数据上作为原生多模态模型进行训练,并通过交互式用户模拟器框架针对多轮次、类似生产环境的协作进行了调优,因此更适合持续的多步骤任务,而非单轮执行。
供应商
DeepSeek-V4 拥有百万字超长上下文,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。 相比 DeepSeek-V4-Pro,DeepSeek-V4-Flash 在世界知识储备方面稍逊一筹,但展现出了接近的推理能力。而由于模型参数和激活更小,相较之下 V4-Flash 能够提供更加快捷、经济的 API 服务。
供应商
DeepSeek-V4 拥有百万字超长上下文,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。 相比前代模型,DeepSeek-V4-Pro 的 Agent 能力显著增强。在 Agentic Coding 评测中,V4-Pro 已达到当前开源模型最佳水平,并在其他 Agent 相关评测中同样表现优异。
供应商
GLM-5.1 是智谱最新旗舰模型,代码能力大大增强,长程任务显著提升,能够在单次任务中持续、自主地工作长达 8 小时,完成从规划、执行到迭代优化的完整闭环,交付工程级成果。 在综合能力与 Coding 能力上,GLM-5.1 整体表现对齐 Claude Opus 4.6,并在长程自主执行、复杂工程优化与真实开发场景中展现出更强的持续工作能力,是构建 Autonomous Agent 与长程 Coding Agent 的理想基座。
供应商
Agentic指令遵循:在包含 50+ skills、60–150 个 feature list 的复杂环境中,M2.7 仍能保持稳定的技能调用与指令遵循能力,有效缓解大规模 skill library 场景下常见的遵从能力下降问题;针对需要 几十个技能协同的复杂任务进行优化,能够在长流程、多步骤的 Agent 场景中稳定完成复杂任务拆解与执行。 领先的 Agent Harness 能力,支持 Agent Teams、多工具检索(Tool Search)、多种 Agent 脚手架功能,便于构建复杂的多 Agent 系统。 强工程与 Coding 能力:在真实工程场景中具备优秀表现,包括 日志分析与 Bug 定位、代码重构、代码安全(生成无漏洞代码)、机器学习、Android 开发 等能力。 复杂 Office 自动化能力:支持复杂 Excel / Word / PPT 办公任务及多轮编辑。
供应商