10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

Qwen3.8-Max 评测:自主编程 16 天、2.4 万亿参数,能否挑战 GPT?

55分钟前 AI最新动态 0 0

先是 GLM5.2,然后是 Kimi K3,现在是 Qwen3.8-Max。从 6 月开始,国产大模型在 Coding 和 Agent 领域明显加速,与海外顶级 SOTA 的差距正在肉眼可见地缩小。

图片 1

参数与定价

Qwen3.8-Max 沿用 Qwen3.5 的架构基础,总参数量扩展至 2.4 万亿,激活参数 950 亿。能力提升的重点是 Coding、Work(办公科研长任务)和 Agent 能力。

更重要的是,Qwen3.8-Max 将成为首个开放权重的 Max 级模型,权重计划于发布后一周在 Hugging Face 和 ModelScope 上线,Qwen3.8-27B 也会开放权重。

定价走「旗舰能力、中端价格」路线:输入 2 美元/百万 tokens,输出 6 美元/百万 tokens,隐式缓存 0.25 美元/百万 tokens——和 GPT 的中端模型差不多,但输出价显著低于所有同级别 GPT 模型。

Coding:自主编程 16 天

这次 Qwen3.8-Max 提供了长时间的自我进化式开发。从一个空文件夹出发,在没有人工帮助的情况下连续工作数天,通过执行结果和外部反馈不断修正计划,最终交付真实项目。

案例一:自进化编程 Harness——从零构建 oh-my-cli,统一用户反馈、社区实践和模型自测到 issue、开发、测试循环中。截至 7 月 30 日,项目自主运行约 16 天,累计产生 265 次提交、127 个 PR 和 151 个 issue。

案例二:复现论文并改进——在没有起始代码条件下连续运行约 125 小时,编写约 7600 行代码,执行 1100 多步操作,完成 33 轮 GPU 训练。前 37 小时复现论文六项主要结论,随后用约 88 小时提出并测试 18 种改进方法,最终在 AIME24 上比复现方法再提高 2.7 分。

案例三:参加真实比赛——在一场 526 支人类队伍参加的多模态电商对话意图识别挑战赛中,模型在 24 小时内独立完成方案设计和 45 次提交,准确率从 0.60 提升到 0.853,超过 458 支队伍(约前 87%)。

Work:多场景泛化能力

Qwen3.8-Max 在 QwenWork、Claude Code、Codex 等多种 Harness 上展现出泛化表现:

图片 2

  • 一小时内从数百份文件中标出 1284 条相关合规条款
  • 一次生成数字银行 App 的八页高保真交互原型
  • 基于供应资料设计 26 道菜并控制食材成本率
  • 从图纸还原 30 层写字楼的抗震结构模型
  • 把二维康复评估单做成三维交互演示
  • 把每名球员约 8400 个攻防回合整理成战术画像和教练报告

长程任务:365 天电商模拟

在 365 天电商模拟基准中,模型用 10 万元启动资金管理选品、议价、库存、定价和退货,面对促销、供应链危机和欺诈商家。最终现金为 416252 元(4.16 倍回报),比第二名 GLM5.2 高 38%,比 Qwen3.7-Max 高 152%。

视觉自我检查:边干边观察

这次模型增加了一个新能力:在任务进行中持续观察自己的中间产物,检查页面布局、物体方向、动画和交互结果,发现偏差后重新规划。视觉以前只是输入,现在变成了 Agent 任务里的反馈通道,可以边干边观察。

图片 3

千问的多模态能力一直不错——可以处理 200 多页财报和复杂 PDF,把 100 多小时长视频组织成可检索记忆,还能把截图还原成前端项目、把户型图做成 Blender 三维效果。

使用方式

Qwen3.8-Max 已在 Qoder 上线,打开即可看到提示信息。目前还有优惠活动,可领取 2000 次调用。

图片 4

API 方面已可通过千问 AI 平台调用,支持 OpenAI chat completions/responses 兼容协议,也提供 Anthropic API 兼容接口。reasoning_effort 可选 xhigh、medium、low 调节推理深度与成本,preserve_thinking 默认开启。

展望

国产模型在长程任务、自主运行、反馈回路、跨 Harness 泛化和视觉自我检查等方面能力越来越强。预计到 2026 年底,对于重度开发者和 Vibe 用户来说,国内大模型有可能从辅助工具变成主力工具。模型用户没有忠诚度,大家会用脚投票的。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Qwen3.8-Max 评测:自主编程 16 天、2.4 万亿参数,能否挑战 GPT?
#Qwen3.8-Max #大模型评测 #自主编程 #阿里千问 #Coding Agent 
收藏 1
Modal 每月免费 30 美元:轻松部署 Kimi K3 等开源模型
Vibe Coding Token 成本分析:工具调用与推理占了 76% 的输出开销
推荐阅读
  • Chrome 融合 Gemini:浏览器升级为可执行的智能代理,哪些工作流会真正受益?
  • GPT-5.6 预览版发布:三大模型 Sol/Terra/Luna,全球用户暂无法使用
  • Qwen3.7-Plus正式发布:多模态混合智能体,视觉与语言统一的新基座
  • Windsurf 免费模型 SWE-1 深度体验:不只是编程,而是完整的软件工程革命
  • 微信AI生态正式内测:小程序自动化操作时代来了
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
32911 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29454 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
21817 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
21508 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
18105 4月前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17580 1年前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
17479 3月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
17036 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
16943 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
15849 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 Qwen3.8-Max 评测:自主编程 16 天、2.4 万亿参数,能否挑战 GPT?
2 Qwen3.8-Max 上线:2.4 万亿参数,自主编程 16 天,API 首发千问 AI 平台
3 Kimi K3 对比 DeepSeek V4 Flash:2.8 万亿参数与 50 倍价差的路线之争
4 MiniMax H3 开源:全模态视频生成模型,支持 2K/15 秒/立体声
5 DeepSeek V4-Flash 正式版:284B 参数九项 Agent 测试全胜,对标 Claude Opus 4.8
6 TRAE Work 上线个人效率工作台:一键复刻、进度可视化、多端适配
7 MiniMax H3视频模型上线:开源路线、多模态输入、0.23元/秒对标Seedance
8 阿里百炼Token Plan限时活动:Qwen3.8-Max夜间0.2折,39元Lite套餐超值体验
9 DeepSeek V4 Flash正式版上线:Agent能力超越GLM5.2,原生适配Codex
10 Agnes AI 2.5发布:2.5 Flash免费编程模型 + 2.5 Pro Alpha复杂工程能力,全模态继续免费
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联