MiMo-V2.6-Pro 是小米自主研发的旗舰级基础模型。该模型参数规模超过 1 万亿(1T),旨在突破应对高难度任务的能力极限。它具备 100 万 token 的上下文窗口及原生多模态能力,并针对智能体(Agent)工作流进行了深度优化;在代码编程、视觉处理、通用任务及科研探索等场景下均展现出顶尖性能,尤其擅长处理复杂且长周期的任务,并在各类智能体应用框架中表现出强大的泛化能力。
供应商
MiMo-V2.6-Flash 是由小米开发的开源基础模型。该模型基于“混合专家”(Mixture-of-Experts)架构构建,总参数量达 3090 亿,每个 Token 激活参数量为 150 亿,并采用混合注意力机制以提升计算效率。它具备 100 万 Token 的上下文窗口及原生多模态能力。该模型针对智能体(Agent)工作流进行了优化,在编程、视觉、通用及研究等场景下表现出色,尤其擅长处理复杂的长程任务,并在多种智能体框架下展现出强大的泛化能力。
供应商
DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。
360自研大模型实时语音同传服务,支持流式语音识别、实时文本翻译与语音合成,实现“边说话边翻译、边翻译边播报”的效果。支持复杂场景下的高精度语音识别与低延迟翻译,支持中英双语及中英混说,精准处理长句、口语及专业术语,适用于跨语言会议、在线会议、直播及多语言交流等场景。
供应商
360自研大模型实时语音翻译服务,支持流式语音识别与多语言文本翻译,实现“边说话边出翻译结果”的效果。支持复杂场景下的高精度语音识别与实时翻译,支持中英双语及中英混说,精准处理长句、口语及专业术语,适用于跨语言会议、在线沟通、多语言交流等场景。
供应商
Qwen3.8-Flash 是千问最新推出的多模态大模型,兼具强大的理解与生成能力和出色的响应速度。模型原生支持百万级上下文窗口,能够一次性处理超长文档、代码仓库和复杂对话。在编程辅助、智能体协作、图文理解等场景中表现尤为出色——无论是自动修复代码、操作桌面应用,还是分析图表与长视频,都能给出准确、高质量的结果。同时兼容 OpenAI 与 Anthropic 主流接口协议,可无缝接入 Claude Code、Codex 等开发者工具,轻松构建高并发应用与智能工作流。凭借优异的性能与极具竞争力的推理成本,Qwen3.8-Flash 是开发者和企业在 AI 应用中兼顾效果与效率的理想选择。
供应商
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能: GLM-5.3-Flash 总参数量 320B、激活参数量 18B,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。在保持精准长上下文能力的同时,显著降低计算与服务成本。相比 GLM-5.3,其注意力计算量和 KV 缓存大小分别降低 3.01 倍和 4.44 倍。 视觉能力被原生融入 Coding 循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。无论是前端开发、游戏构建、Blender 3D 场景,还是 BUA、CUA 驱动的真实环境操作,模型都能在代码、浏览器和图形界面之间协同完成任务。 GLM-5.3-Flash 进一步拓展至 Office、金融研究和专业文档等工作场景。它能够自主拆解复杂目标、调用合适工具、检查并优化输出,完成从研究分析、模型构建到 PPTX、PDF、DOCX、XLSX 成品交付的完整工作流。
deepseek-v4-flash-vision-exp 模型支持在文本之外输入图片,你可以让模型描述图片、识别截图中的文字、分析图表等。 支持的图片格式:JPEG、PNG、GIF、WebP。格式由文件实际内容判断,而非文件名或声明的 MIME 类型。
供应商
GLM-5.3 是智谱最新旗舰模型,复杂软件工程与 Agent 任务能力全面进阶。它使用与 GLM-5.2 相同的基础模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务方面表现更加出色。 GLM-5.3 目前仅支持处理文本模态信息,支持 1M 上下文窗口,最大输出 Tokens 为 128K。 GLM-5.3 会始终启用思考功能,支持三个思考强度级别:low、high 和 max,并不再支持禁用思考功能。
Music 3.0 专注于音乐创作中最难以被简单提示词概括的部分:真正理解创作者的表达意图,在最长 5 分钟的完整歌曲中持续贯彻这一意图,以清晰且富有真实质感的方式呈现乐器,并让生成的人声更像真实演唱,而不是机器合成。
供应商
万相3.0是 all-in-one 视频生成模型,统一支持参考、编辑、复刻、驱动等多种创作功能,四模态全能参考,最长支持30秒视频生成,可解析文件、网页及复杂图片。生产级角色一致性保持,音画真实,带来身临其境的视听冲击力。
供应商
供应商
指令理解清晰:支持最大 4.5k token 输入,复杂图文指令一次生成到位。 文字渲染稳定:10px 小字、12 国语言、20+ 字体清晰可辨,信息图和界面直接可用。 批量产出趁手:海报、网页、界面等日常任务可批量生成,成本更优,适合持续创作。 Qwen-Image-3.0 Standard 不只在追求生成效果,更在追求日常创作里的顺手与省心——让图像生成成为可持续的内容生产力。
供应商
2.4万亿参数MoE旗舰,编程与办公能力全面跃升,可自主编程十数天交付完整项目。胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果。原生视觉理解贯穿规划、执行与验证全流程,支持超长文档与长视频的深度语义解析。长程任务中自主规划与闭环迭代,持续进化。
供应商
内容丰实:支持最大 4.5k token 输入,支持图中图密集信息排版,让报纸、分镜、菜单、试卷等复杂版面一次生成。 细节真实:支持 10px 小字精准渲染,微表情、毛孔、发丝等细节生动还原,逼近真实摄影的质感。 知识厚实:支持 12 国语言、多种字体原生渲染,主流网页、游戏、直播等界面仿真,外部知识全纳入。 Qwen-Image-3.0-Pro 不只是在追求"好看",更在追求“好用”——让图像生成真正成为可落地的生产力工具。
供应商
Kimi K3 是 Kimi 迄今能力最强的旗舰模型,拥有 2.8 万亿参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
Qwen3.7原生视觉语言系列Flash模型,相较3.6-Flash全面提升多模态理解与Agent执行能力。重点强化多模态基础能力、万物识别能力更强,真实世界感知与空间智能进一步提升,Search Agent、CI Agent等多模态Agent场景能力显著升级、端到端任务执行更稳定,多模态Coding能力优化、vibe coding 体验更加流畅。
供应商