#评测

GPT Images 2.0 实测:10 大应用场景详解,中文字体支持重大升级
GPT Images 2.0 发布后第一时间进行了实测。这次从多个实用应用领域测试了 Images 2.0 模型的能力,结果令人印象深刻。 苏米注:最明显的进步是中文字体支持,基本没有错别字,复杂图形的排版布局能力也大幅提升。 1. 一…
AI操作系统三国杀:Hermes vs OpenClaw vs WorkBuddy 全方位对比评测
2025-2026 年,AI操作系统赛道突然热闹起来。三个代表性产品走出了三条完全不同的路: Hermes Agent:开源极客路线 OpenClaw:本地隐私优先 WorkBuddy:大厂生态路线 苏米注:这场"三国杀"本质上不是技…
Hermes 接入 Kimi K2.6 实测:SOTA 代码能力深度评测,不限流但推理速度慢
昨天 Kimi Code 悄悄推了一条通知:K2.6-code-preview 已上线,向所有订阅用户开放。今天我把 Hermes 里 23 个 Agent 全切了过去,跑了整整一天。 结论先说:K2.6 目前是我用过的国产编程模型里最强的…
Hermes Agent vs OpenClaw 深度对比:47k Star 新贵与 349k 老牌谁更强?
最近,Nous Research 发布了一个新项目 Hermes Agent,短短几天就收获了 47.2k Star 和 6.1k Fork。作为一个 OpenClaw 深度用户,我决定花一周时间深度体验,从安装部署到源码架构,全方位对比这…
GLM-5.1 代码能力实测:SWE-Bench Pro 全球第一,长程任务可连续工作 8 小时
2026 年 4 月 8 日,智谱发布了 GLM-5.1 模型更新。官方博客披露的评测数据显示,这款开源模型在 SWE-Bench Pro(真实 GitHub 工程 Bug 修复)榜单上取得了 58.4 分,超越 GPT-5.4(57.7 …
LMArena:这个大模型评测试用台,全免费!GPT-5.2、Claude 4.5、Gemini 3 随便用
作为一名常年跑新模型、做选型评测的产品经理,如果只把 LMArena 视为一个查看“公开模型对比平台”,那你就错了。 普通用户可以在这里薅羊毛。 你可以免费体验 GPT-5.2、Gemini 3 Pro、C…
OpenCode + oh-my-opencode,这才是编程AI Agent该有的样子
作为长期评测 AI 开发工具的产品经理,我对“AI 写代码”这类产品向来谨慎。多数工具能快速生成片段,但难以在真实项目里长期稳定地协作。 过去一段时间我在两个持续迭代的代码库里用 OpenCode 做了多轮试用,最大…
盘点4个AI大模型评测榜单网站,2026最全 AI 大模型选型榜单参考指南,建议收藏!
最近这半年,各大模型厂商密集发布新版本,从OpenAI、Anthropic到国内的GLM、Qwen,新模型层出不穷。 问题随之而来:这些模型到底处于什么水平?性能、成本、推理速度如何权衡? 如果你也有过这样的困惑,比如GLM 4.7发布后不…