10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

DeepSeek V4-Flash 正式版:284B 参数九项 Agent 测试全胜,对标 Claude Opus 4.8

1月前 AI最新动态 634 0

DeepSeek-V4-Flash 正式版已发布

该模型以 284B 总参数(每 token 激活 13B)的体量,在九项 Agent 基准测试中全部超过此前最强的 DeepSeek-V4-Pro 预览版(1.6T 总参数,激活 49B)

其中最显著的 DeepSWE 测试,得分从 7.3 飙升至 54.4,增长六倍多,而 API 价格保持不变:输入 1 元/百万 token,输出 2 元/百万 token。

图片 1

九项 Agent 测试全胜

DeepSeek-V4-Flash 正式版在以下九项基准测试中均取得最高分:

  • Terminal Bench 2.1:82.7 分(预览版 61.8,Pro 预览版 72.1)
  • NL2Repo:54.2 分
  • CyberGym:76.7 分(预览版 38.7,Pro 预览版 52.7)
  • DeepSWE:54.4 分(预览版 7.3,Pro 预览版 12.8)
  • Toolathlon Verified:70.3 分
  • Agents' Last Exam:25.2 分
  • AutomationBench:25.1 分
  • DSBench-FullStack:68.7 分
  • DSBench-Hard:59.6 分

需要说明的是,这九项基准均为 Agent 和编码类测试,传统知识问答类测试上 Pro 的参数优势依然存在。

DeepSWE:从 7.3 到 54.4

DeepSWE 包含 113 个原创软件工程任务,涵盖五种编程语言。AI 需要在隔离环境中持续修改代码、测试、定位并修复 bug,全程不能中断,考察模型持续编程能力。

预览版仅得 7.3 分,正式版直接飙到 54.4,超过 GLM-5.2(46.2),与 Claude Opus 4.8(58.0)仅差 3.6 分。

CyberGym 测试同样表现突出,从 38.7 涨至 76.7,接近翻倍。该测试要求 AI 在真实开源项目中找出安全漏洞并写出复现攻击代码。

图片 2

架构未变,提升来自后训练

V4-Flash 正式版的模型架构、预训练数据、参数量与前代完全一致,所有提升均来自后训练。

DeepSeek 采用先训练多个领域专家模型(监督微调 + GRPO 强化学习),再通过蒸馏整合到统一模型的后训练框架。

推测本次优化了工具调用格式、长任务规划、代码修改后的测试验证以及执行失败后的自动恢复能力。

对标 Claude Opus 4.8

在多项指标上,DeepSeek-V4-Flash 与 Claude Opus 4.8 的差距在 3-6 分,Agents' Last Exam 仅差 0.5 分。

所有有数据的项目均高于 GLM-5.2。

有开发者本地部署后测试反馈"各项测试只落后 Claude Opus 4.8 大约 3 分"。

定价优势

  • 输入(非缓存):1 元/百万 token
  • 输入(缓存命中):0.02 元/百万 token(正价的 2%)
  • 输出:2 元/百万 token
  • 并发上限:2500(Pro 为 500)

实测 DeepSeek 模型缓存命中率在 90% 以上,实际输入成本极低。

跑一次 Agent 任务成本可能仅几分钱到几毛钱。

横向对比,Claude Opus 4.8 输出价格约 168 元/百万 token,相差约 80 倍。

图片 3

原生对接 Codex 和 Responses API

DeepSeek-V4-Flash 正式版原生支持 OpenAI Responses API 格式,已针对 Codex 做专门适配。

可在 Codex CLI、桌面端、VS Code 扩展中直接使用,base_url 指向 api.deepseek.com,模型名填 deepseek-v4-flash。

Responses API 支持流式输出、工具调用、推理档位切换(low/high/max)和结构化输出。

但目前仅 Flash 支持,V4-Pro 预计 8 月初适配。图片输入、文件上传、MCP 工具、Computer Use 暂不支持。

当前为无状态接口,需自行携带上下文。

DeepSeek Harness 布局

DeepSeek 正在打造自己的 Harness(执行框架),负责工具调用、终端运行、上下文管理等模型外工作。

团队负责人崔天一此前在 Jane Street 从事量化交易九年,今年 3 月加入 DeepSeek 组建 Harness 团队,明确对标 Claude Code。

图片 4

测试前提与注意事项

  • 所有 Agent 测试均在 max 推理档位下运行(top_p 0.95、temperature 1.0),实际使用中可根据需要调整。
  • DSBench-FullStack 和 DSBench-Hard 为 DeepSeek 内部测试集,任务和评分标准未公开。
  • Harness 极简模式尚未发布,外部研究者暂时无法完整复现测试条件。
  • 本次仅升级 Flash 的 API 接口,App 和网页端模型未变化,V4-Pro 正式版尚未发布。

适用场景

如果场景以代码和工具为主(写代码、修 bug、运行终端、调用 API、搭建 Agent),Flash 正式版即可满足。

模型支持 100 万 token 上下文和 38.4 万 token 最大输出,兼容 OpenAI ChatCompletions 和 Anthropic Messages 两种 API 格式。

图片 5

如需上传图片、文件,或依赖 MCP 和 Computer Use,目前暂不支持。

图片 6

开源信息

DeepSeek-V4-Flash 已在 Hugging Face 开源,MIT 协议,可商用。

已有开发者在两台 DGX Sparks 上跑出 77 token/秒的速度,百万 token 上下文下同时运行 Gemma-4-12B 处理视觉任务。284B 完整 MoE 权重需常驻显存,硬件门槛较高。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:DeepSeek V4-Flash 正式版:284B 参数九项 Agent 测试全胜,对标 Claude Opus 4.8
#DeepSeek #V4-Flash #Agent基准 #开源模型 #Claude 
收藏 1
DeepSeek V4-Flash 接入 Codex:一行命令配置,性价比对标 GPT-5.6 Luna
3 个近期 GitHub 热门开源项目:Buzz 协作平台、OpenMinis 手机 Linux 沙箱、Bento 单文件幻灯片
推荐阅读
  • 字节跳动发布 Vidi2 :AI 视频模型性能超越 Gemini 3 Pro,小时级素材直出剪辑方案
  • 阿里云Coding Plan:告别烧token焦虑,按次计费,支持千问3.5、GLM-5、Kimi-K2.5等模型
  • Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
  • OceanBase 发布 AI 数据库:Agent 时代的企业数据底座
  • KAT-Coder-Pro V2发布:Claude Code + KAT-Coder-Pro V2实测新一代代码助手在前端生成与审美上显著进化
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34043 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30642 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23414 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22823 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
21020 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18899 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18496 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18331 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18081 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16536 1年前

文章目录

关于苏米客
分类排行
1 阿里内测 Qovest AI 金融投研 Agent:面向个人投资者的智能研究助手
2 Qoder 国际版限时福利:Qwen3.8-Flash 模型 0 元免费用至 9 月 30 日
3 GLM-5.3-FlashX 上线:推理提速 5 倍达 200 tokens/s,Agent 构建推理 Infra
4 Jev 模型发布:OpenAI 核心大佬打造纯决策 AI,速度快 200 倍成本降 400 倍
5 HD-V1 视频模型实测:先理解再生成,音画同步与物理规律全面突破
6 Agent 自动上传代码库引隐私担忧:开源办公 Agent 为何更重要——以有道 LobsterAI 为例
7 小米 MiMo-V2.6 公开 RL 训练直播:两天烧掉千万,过程数据成研究金矿
8 Anthropic公开AI递归自我改进核心数据:3万Agent参与研发,人类正退出一线
9 Gemini 3.8 Live 发布:语音天梯榜登顶,价格仅为 OpenAI 实时 API 的三分之一
10 OpenAI Codex 用户反馈:300 万阅读量下的额度限制、产品定位与体验痛点
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联