先是 GLM5.2,然后是 Kimi K3,现在是 Qwen3.8-Max。从 6 月开始,国产大模型在 Coding 和 Agent 领域明显加速,与海外顶级 SOTA 的差距正在肉眼可见地缩小。

参数与定价
Qwen3.8-Max 沿用 Qwen3.5 的架构基础,总参数量扩展至 2.4 万亿,激活参数 950 亿。能力提升的重点是 Coding、Work(办公科研长任务)和 Agent 能力。
更重要的是,Qwen3.8-Max 将成为首个开放权重的 Max 级模型,权重计划于发布后一周在 Hugging Face 和 ModelScope 上线,Qwen3.8-27B 也会开放权重。
定价走「旗舰能力、中端价格」路线:输入 2 美元/百万 tokens,输出 6 美元/百万 tokens,隐式缓存 0.25 美元/百万 tokens——和 GPT 的中端模型差不多,但输出价显著低于所有同级别 GPT 模型。
Coding:自主编程 16 天
这次 Qwen3.8-Max 提供了长时间的自我进化式开发。从一个空文件夹出发,在没有人工帮助的情况下连续工作数天,通过执行结果和外部反馈不断修正计划,最终交付真实项目。
案例一:自进化编程 Harness——从零构建 oh-my-cli,统一用户反馈、社区实践和模型自测到 issue、开发、测试循环中。截至 7 月 30 日,项目自主运行约 16 天,累计产生 265 次提交、127 个 PR 和 151 个 issue。
案例二:复现论文并改进——在没有起始代码条件下连续运行约 125 小时,编写约 7600 行代码,执行 1100 多步操作,完成 33 轮 GPU 训练。前 37 小时复现论文六项主要结论,随后用约 88 小时提出并测试 18 种改进方法,最终在 AIME24 上比复现方法再提高 2.7 分。
案例三:参加真实比赛——在一场 526 支人类队伍参加的多模态电商对话意图识别挑战赛中,模型在 24 小时内独立完成方案设计和 45 次提交,准确率从 0.60 提升到 0.853,超过 458 支队伍(约前 87%)。
Work:多场景泛化能力
Qwen3.8-Max 在 QwenWork、Claude Code、Codex 等多种 Harness 上展现出泛化表现:

- 一小时内从数百份文件中标出 1284 条相关合规条款
- 一次生成数字银行 App 的八页高保真交互原型
- 基于供应资料设计 26 道菜并控制食材成本率
- 从图纸还原 30 层写字楼的抗震结构模型
- 把二维康复评估单做成三维交互演示
- 把每名球员约 8400 个攻防回合整理成战术画像和教练报告
长程任务:365 天电商模拟
在 365 天电商模拟基准中,模型用 10 万元启动资金管理选品、议价、库存、定价和退货,面对促销、供应链危机和欺诈商家。最终现金为 416252 元(4.16 倍回报),比第二名 GLM5.2 高 38%,比 Qwen3.7-Max 高 152%。
视觉自我检查:边干边观察
这次模型增加了一个新能力:在任务进行中持续观察自己的中间产物,检查页面布局、物体方向、动画和交互结果,发现偏差后重新规划。视觉以前只是输入,现在变成了 Agent 任务里的反馈通道,可以边干边观察。

千问的多模态能力一直不错——可以处理 200 多页财报和复杂 PDF,把 100 多小时长视频组织成可检索记忆,还能把截图还原成前端项目、把户型图做成 Blender 三维效果。
使用方式
Qwen3.8-Max 已在 Qoder 上线,打开即可看到提示信息。目前还有优惠活动,可领取 2000 次调用。

API 方面已可通过千问 AI 平台调用,支持 OpenAI chat completions/responses 兼容协议,也提供 Anthropic API 兼容接口。reasoning_effort 可选 xhigh、medium、low 调节推理深度与成本,preserve_thinking 默认开启。
展望
国产模型在长程任务、自主运行、反馈回路、跨 Harness 泛化和视觉自我检查等方面能力越来越强。预计到 2026 年底,对于重度开发者和 Vibe 用户来说,国内大模型有可能从辅助工具变成主力工具。模型用户没有忠诚度,大家会用脚投票的。