WorkBuddy 的 TokenHub 平台内置了 11 个大模型,从几块钱到二十几块钱每百万 Token 不等,价格差十几倍,能力侧重点也完全不一样。选错了,要么多花钱,要么任务跑不动。这篇把 11 个都捋一遍,告诉你每个该在什么时候用。
先记三个王,这是最常用的三个。综合能力之王是 MiniMax-M3,它是第一个三合一的国产旗舰,把前沿 Coding、1M 上下文、原生多模态揉在一起,输入 2.1 元每百万输出 8.4 元每百万,在支持 1M 上下文的模型里最便宜,综合评分 86.8 全场最高。性价比之王是 DeepSeek-V4-Flash,输入 1 元输出 2 元,速度是 Pro 的三到四倍价格是它的十二分之一,日常高频调用就选它。推理之王是 DeepSeek-V4-Pro,输入 12 元输出 24 元,世界知识、复杂推理、长上下文精度都顶到最高,SimpleQA 达到 57.9%,HLE 37.7%,是不能出错场景的唯一选择。
接着按用途记四类。写代码找 Kimi-K2.7-Code,它在 K2.6 基础上做了编程专项后训练,代码生成和代码库理解最强。要看超长代码库找 GLM-5.2,全球首个 1M 无损上下文窗口,Code Arena 评分 1595 排全球第二,一次能加载整个代码仓库。要做视觉加编程,比如 UI 截图转代码、设计稿还原,找 GLM-5V-Turbo,它是专门面向视觉编程的多模态模型。要跑 Agent 集群和长程编码,找 Kimi-K2.6,能连续编码 13 小时写出 4000 多行代码。
再记几个有特色的。Hy3 preview 是腾讯混元重建后的首作,复杂推理和 Agent 能力突出,数学竞赛和科学推理评测上表现亮眼,特别适合当 AI 工作流的核心调度引擎,输入 16K 内只要 1.2 元,是高端模型里的性价比选择。GLM-5.1 是 GLM-5.2 的前代旗舰,能力均衡经过大量实战验证,适合企业已有 GLM 生态要平滑过渡的场景,但建议新项目直接用 5.2 替代。Kimi-K2.5 是通用多模态 Agent,唯一支持 Batch API 的 Kimi 模型,大批量异步处理时通常半价,是中小团队日常助手的实惠选择。Qwen3.5-Plus 是阿里生态的集成担当,跟 ODPS、DataWorks、钉钉无缝打通,128K 内输入只要 0.8 元,是全场短输入最低价。
企业用起来,不用纠结选哪一个,官方给了一张一主一备的推荐矩阵,覆盖十大场景。智能问答客服,主 Flash 备 K2.5。文档制作报告生成,主 Hy3 备 Pro。代码开发,主 K2.7-Code 备 GLM-5.2。数据分析商业智能,主 MiniMax-M3 备 Qwen3.5。Agent 自动化工作流,主 K2.6 备 Hy3。UI 设计视觉编程,主 GLM-5V-Turbo 备 MiniMax-M3。法务合同审查,主 Pro 备 GLM-5.2。知识管理企业搜索,主 K2.5 备 Qwen3.5。科研学术推理,主 Pro 备 Hy3。多语言翻译,主 GLM-5.1 备 Flash。
企业真正的最佳实践,不是选一个模型,而是搭一层智能路由。意图分类先交给 Flash,它快又便宜。简单任务由 Flash 或 MiniMax-M3 直接完成。复杂推理路由到 Pro 或 Hy3。代码任务路由到 K2.7-Code 或 GLM-5.2。视觉任务路由到 GLM-5V-Turbo 或 MiniMax-M3。批量处理走 K2.5 的 Batch API 半价。这套路由相比全量用 Pro,能省下六到八成的 API 支出,关键任务的质量还不掉。
最后是本地部署。要数据不出内网,金融医疗政务这类场景,黄金组合是 DeepSeek-V4-Flash 加 GLM-5.2。Flash 低门槛可量化部署,GLM-5.2 支持国产算力满足信创要求。中小企业没有 GPU 集群的,别自建,优先走云端 API 加 Flash 和 Pro 的智能路由。
一句话收尾。日常图快图便宜用 Flash,写代码用 K2.7-Code,看超长文档用 GLM-5.2,不能出错用 Pro,想全能一步到位用 MiniMax-M3。
