阅读闭源模型篇
对比 GPT、Gemini、Claude、Grok、Qwen 和豆包的日常体验与适用场景。
本文最后更新于 2026 年 5 月 11 日。模型体验具有主观性,版本、量化方式、推理框架、系统提示词和业务数据都可能改变结果。请结合自己的任务和线上指标判断。
如何阅读本文
模型榜单只能提供线索,不能代替业务评估。本文主要关注以下维度:开源与闭源如何选择
实际业务经常采用混合路由:便宜、稳定的开源模型承担分类、抽取、RAG 和常规 Agent 任务,闭源模型处理少量高难推理、复杂工程或高价值内容。
开源模型生态
本文重点讨论 2025 年以来热度较高的系列。模型参数、许可证和架构细节应以 Hugging Face Model Card、config.json 和厂商仓库为准。
DeepSeek:开源大模型的基准线
DeepSeek 从 Dense 模型发展到 V2、V2.5 的 MoE 路线,再到 V3 和 R1 大规模使用强化学习与合成数据。它长期以较低 API 成本提供大参数模型,因此经常成为企业接入和新模型比较时的基准。 早期 V3 和 R1 的能力提升很明显,但实际使用中也容易出现幻觉偏高、文风发散和过度推演。后续版本逐步改善稳定性,V3.1 合并思考与非思考能力,V3.2 引入稀疏注意力并支持交错思考。 从日常体验看,DeepSeek 更像覆盖面很广的通用选手:知识、推理、代码和写作都能处理,但关键业务仍需要事实校验、结构化约束和回归测试。V3 与 R1 系列
V4 系列
DeepSeek V4 系列进一步强化长上下文与缓存计费优势。实际使用时,先把需求相关文件和背景材料完整放入上下文,通常比只给一句抽象指令更有效。
适合场景:高性价比通用 API、长文档处理、RAG、批量任务和成本敏感的 Agent。
需要注意:高价值事实、复杂工程修改和长链路 Agent 任务必须增加验证环节。
Qwen:覆盖最完整的开源矩阵
Qwen 从 2.5 世代开始形成完整的尺寸矩阵,并同时覆盖语言、视觉、代码和端侧场景。它的优势不只是单个模型得分,而是权重、工具链、量化版本和社区生态较完整。 Qwen3 初版的后训练效果存在争议,2507 系列明显改善了可用性。选择 Qwen3 变体时,需要区分 Thinking、Instruct、VL、Coder 和 Next,不能只比较参数量。Qwen3 通用系列
Qwen3-VL 系列
Coder、Next 与 3.5/3.6
适合场景:私有化部署、视觉理解、模型微调、端侧应用和需要完整开源工具链的团队。
需要注意:型号非常多。评估时固定准确版本、量化精度和推理参数,避免把不同后训练版本混在一起比较。
GLM、MiniMax 与 Kimi:Coding Agent 主力
GLM
GLM 从 ChatGLM 时代积累了中文和本地部署经验。GLM-4 后期重新加强开源投入,4.5 到 4.7 世代的 Coding 和 Agent 能力提升明显。
GLM-5 系列的上限较高,但大模型也带来推理速度和服务稳定性压力。业务评估不能只看正确率,还要记录断流率、首 Token 延迟和高峰期吞吐。
MiniMax
MiniMax-M2 使用较小激活参数切入 Coding Agent,在输出速度和推理成本上有优势。真实软件工程通常需要多轮“修改、测试、反馈、再修复”,速度会直接影响总工时。
MiniMax 还具备音频和视频生成产品线,适合希望统一采购文本与多媒体能力的团队。
Kimi
Kimi K2 通过大参数 MoE 获得较强的知识覆盖和代码泛化能力。它在搜索、长上下文和前端开发方面表现突出,但 1T 规模也意味着更高推理成本和更慢速度。
适合场景:长上下文搜索、研究、复杂前端代码、需要视觉输入的 Agent。
腾讯、小米与美团:应用生态驱动
Hunyuan
腾讯在视频、3D 和多模态方向投入较多。通用语言模型需要按具体版本评估,其中 Hunyuan-A13B 在中等规模部署中具备一定性价比。混元 3D 更适合结合腾讯已有内容与游戏生态观察。MiMo
MiMo 的价值在于 Coding、Agent 与智能硬件结合。MiMo-VL-Miloco-7B 面向智能家居视觉理解,尺寸较小,便于私有化;MiMo-V2-Flash 是 309B-A15B MoE,强调代码和 Agent 性能。LongCat
LongCat-Flash 是 560B-A27B MoE,并延伸到图像和视频模型。现阶段通用语言能力需要与同价位的 Qwen、MiMo、GLM 和 MiniMax 做真实业务对照,重点看输出成本是否能转化为更低返工率。GPT-OSS 与 Gemma:研究和端侧路线
GPT-OSS
GPT-OSS 展示了稀疏注意力、原生 MXFP4 和在思考过程中调用工具等设计。它更适合作为研究、教学和推理框架适配对象,而不是默认的中文生产模型。Gemma
Gemma 3 在海外社区拥有较成熟的微调生态,并提供 QAT 权重。量化感知训练版本在低精度下通常比传统训练后量化更容易保持能力,适合显存有限的 HomeLab 和端侧部署。
医疗微调的 MedGemma、端侧方向的 Gemma 3n 和其他变体应单独评估许可证、数据边界和领域可靠性。
日常选型建议
这里的“优先测试”不是最终推荐。同一模型在官方 API、第三方推理、不同量化版本和不同系统提示词下可能表现得像不同产品。
建立自己的评估集
1
收集真实任务
从历史工单、代码修改、文档问答和失败案例中抽取 30 到 100 个代表性任务。不要只使用公开榜单题目。
2
固定运行条件
固定模型版本、温度、最大输出、系统提示词、工具定义、量化精度和上下文材料。
3
同时记录质量和成本
除了正确率,还要记录输入输出 Token、缓存命中、首 Token 延迟、总耗时、重试次数和人工修复时间。
4
检查稳定性
对关键任务重复运行,观察格式漂移、偶发幻觉、工具误调用和高峰期限流。
5
按风险路由
让便宜模型处理可验证任务,高能力模型处理复杂任务,并为高风险结果增加人工或程序校验。