【360在阿里云部署版】DeepSeek-R1 在后训练阶段大规模使用了强化学习技术,在仅有极少标注数据的情况下,极大提升了模型推理能力。在数学、代码、自然语言推理等任务上,性能比肩 OpenAI o1 正式版。
供应商
【 deepseek-V3-0324 新版 V3 模型借鉴 DeepSeek-R1 模型训练过程中所使用的强化学习技术,大幅提高了在推理类任务上的表现水平,在数学、代码类相关评测集上取得了超过 GPT-4.5 的得分成绩。
供应商
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能: GLM-5.3-Flash 总参数量 320B、激活参数量 18B,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。在保持精准长上下文能力的同时,显著降低计算与服务成本。相比 GLM-5.3,其注意力计算量和 KV 缓存大小分别降低 3.01 倍和 4.44 倍。 视觉能力被原生融入 Coding 循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。无论是前端开发、游戏构建、Blender 3D 场景,还是 BUA、CUA 驱动的真实环境操作,模型都能在代码、浏览器和图形界面之间协同完成任务。 GLM-5.3-Flash 进一步拓展至 Office、金融研究和专业文档等工作场景。它能够自主拆解复杂目标、调用合适工具、检查并优化输出,完成从研究分析、模型构建到 PPTX、PDF、DOCX、XLSX 成品交付的完整工作流。
供应商
GLM-5.3 是智谱最新旗舰模型,复杂软件工程与 Agent 任务能力全面进阶。它使用与 GLM-5.2 相同的基础模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务方面表现更加出色。 GLM-5.3 目前仅支持处理文本模态信息,支持 1M 上下文窗口,最大输出 Tokens 为 128K。 GLM-5.3 会始终启用思考功能,支持三个思考强度级别:low、high 和 max,并不再支持禁用思考功能。
供应商
GLM-5.2 是面向长任务时代的旗舰模型。支持真正可用的 1M 上下文,实测可承载项目级工程上下文,长程任务执行更稳定、工程规范遵循更可靠,开发场景成功率进一步提升。一次任务即可完成“从需求到多端可部署产物”的完整开发链路。
供应商
内部特定业务专业模型
供应商
DeepSeek-V4 拥有百万字超长上下文,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。 相比 DeepSeek-V4-Pro,DeepSeek-V4-Flash 在世界知识储备方面稍逊一筹,但展现出了接近的推理能力。而由于模型参数和激活更小,相较之下 V4-Flash 能够提供更加快捷、经济的 API 服务。
供应商
DeepSeek-V4 拥有百万字超长上下文,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。 相比前代模型,DeepSeek-V4-Pro 的 Agent 能力显著增强。在 Agentic Coding 评测中,V4-Pro 已达到当前开源模型最佳水平,并在其他 Agent 相关评测中同样表现优异。
供应商