#评测
腾讯 WorkBuddy Bench 开源:260 道 Agent 评测任务 + 2 个自动化 Skill
腾讯 WorkBuddy 团队最新开源了 2 个 Agent Skill:wbbench-report-skills 和 wbbench-run-setup。
WorkBuddy Bench 是 WorkBuddy 产品工程实践的副产品&m…
Qwen 3.8 Max 实测:与 Kimi K3 三场景对比,工程严谨度更胜一筹
两周多前实测 Kimi K3 时,结论是国产模型已经摸进了第一梯队。
本周 Qwen 3.8 Max 发布,我的第一反应是没兴趣——印象里它的编程能力不太行。
但 Qoder 正好在送 800 次免费调用,于是我用 …
Qwen3.8-Max 评测:自主编程 16 天、2.4 万亿参数,能否挑战 GPT?
先是 GLM5.2,然后是 Kimi K3,现在是 Qwen3.8-Max。从 6 月开始,国产大模型在 Coding 和 Agent 领域明显加速,与海外顶级 SOTA 的差距正在肉眼可见地缩小。
参数与定价
Qwen3.8-Max 沿…
阿里开源 skill-up:Agent Skill 的声明式评测框架,告别'感觉有用'
2026 年,Agent Skill 已经不是什么新概念了。Claude Code、Codex、Cursor 都在用 Skill 增强 Agent 能力,SkillsBench 的研究数据也证实:精心编写的 Skill 能让任务完成率平均提…
Kimi K3 深度评测:2.8T 参数开源模型,性能能否媲美旗舰?
近日,Kimi K3 正式发布,成为目前参数规模最大的开源大语言模型,引发业界广泛关注。如何看待这一模型的实际能力?本文将从多个维度进行分析。
性能表现是否接近旗舰水平?
综合多家国际评测机构的测试结果,Kimi K3 的性能表现基本可信。…
Qwen-3.8-Max 限时 0.2 折,Kimi K3 下架后的平替方案
Kimi K3 近期突然下架了部分套餐方案。从实际参数规模来看,当前算力分配可能倾向于更强性能的模型,同时兼顾合规需求的用户群体。目前该套餐已无法通过常规渠道采购。
关于 K3 的实际使用体验,综合用户反馈主要有两点:
前端表现优于后端,…
Agent Eval 系统构建指南:概念、评估方法与落地路线
如果你在做 AI Agent,迟早会遇到一个的问题:用户说“这个版本好像变差了”,但你很难说清楚到底差在哪里。
是模型能力退步了?Prompt 改坏了?工具调用路径变长了?某个边界 case 被破坏了?还是只是一次随…
OpenCode 发布大模型调用数据报告:DeepSeek 用量第一,Qwen 缓存命中率 98%
OpenCode 近日正式发布 OpenCode Data Report,开发者现可通过官方页面实时获取大模型调用数据。报告涵盖了 2026 年 4 月 18 日至 6 月 12 日期间的编码代理领域数据,揭示了当前 AI 编码市场的"性能…
GLM-5.2 + ZCode vs GPT-5.5 + Codex 实测对比:国产 Coding 模型能否一战?
智谱的 GLM-5.2 确实打破了我对国产模型 Coding 能力的偏见。它的实力能跟 Claude 和 GPT 坐一桌,用它做开发完全没有问题。
实话实说,GLM 最新系列在我心中一直是国产 Coding 大哥,算是目前在商业闭源模型打压…
Claude Opus 4.8 深度解析:从聊天机器人到自主工作系统的进化
Claude Opus 4.8 发布后,开发者的评价呈现一致性:它更擅长执行任务了,但也展现出更强的"个性"
这次更新没有出现"一夜之间碾压所有模型"的戏剧性效果,官方 benchmark 的分数提升幅度也并不惊人
但真正引发广泛讨论的,是…