#模型评测
GLM 5.3 实测:750B 参数后训练逼平 GPT-5.6,复杂编码与安全能力全面评测
GLM5.3 API上线了,昨天又充值了GLM Coding Plan。
5.3的定位很直接,擅长复杂编码,长程Agent任务,加上防御性网络安全。
AA榜成绩也出来了,GLM-5.3拿到60分,也是进了前十。60分及以上的模型一共六个,G…
Qwen 3.8 Max 实测:与 Kimi K3 三场景对比,工程严谨度更胜一筹
两周多前实测 Kimi K3 时,结论是国产模型已经摸进了第一梯队。
本周 Qwen 3.8 Max 发布,我的第一反应是没兴趣——印象里它的编程能力不太行。
但 Qoder 正好在送 800 次免费调用,于是我用 …
Qwen3.8-Max 评测:自主编程 16 天、2.4 万亿参数,能否挑战 GPT?
先是 GLM5.2,然后是 Kimi K3,现在是 Qwen3.8-Max。从 6 月开始,国产大模型在 Coding 和 Agent 领域明显加速,与海外顶级 SOTA 的差距正在肉眼可见地缩小。
参数与定价
Qwen3.8-Max 沿…
Kimi K3 深度评测:2.8T 参数开源模型,性能能否媲美旗舰?
近日,Kimi K3 正式发布,成为目前参数规模最大的开源大语言模型,引发业界广泛关注。如何看待这一模型的实际能力?本文将从多个维度进行分析。
性能表现是否接近旗舰水平?
综合多家国际评测机构的测试结果,Kimi K3 的性能表现基本可信。…
Qwen-3.8-Max 限时 0.2 折,Kimi K3 下架后的平替方案
Kimi K3 近期突然下架了部分套餐方案。从实际参数规模来看,当前算力分配可能倾向于更强性能的模型,同时兼顾合规需求的用户群体。目前该套餐已无法通过常规渠道采购。
关于 K3 的实际使用体验,综合用户反馈主要有两点:
前端表现优于后端,…
OpenCode 发布大模型调用数据报告:DeepSeek 用量第一,Qwen 缓存命中率 98%
OpenCode 近日正式发布 OpenCode Data Report,开发者现可通过官方页面实时获取大模型调用数据。报告涵盖了 2026 年 4 月 18 日至 6 月 12 日期间的编码代理领域数据,揭示了当前 AI 编码市场的"性能…
Step 3.7 Flash:10 秒生成千行代码,生产级 Agent 的高效率之选
阶跃星辰是国内 AI 公司中较为低调但技术实力强劲的一家。从开源 Step 3.5 Flash 到推出 Step Audio 2.0,其模型迭代速度一直很快。5 月 30 日,Step 3.7 Flash 正式上线。
根据官方信息,Step…
Hermes 接入 Kimi K2.6 实测:SOTA 代码能力深度评测,不限流但推理速度慢
昨天 Kimi Code 悄悄推了一条通知:K2.6-code-preview 已上线,向所有订阅用户开放。今天我把 Hermes 里 23 个 Agent 全切了过去,跑了整整一天。
结论先说:K2.6 目前是我用过的国产编程模型里最强的…
LMArena:这个大模型评测试用台,全免费!GPT-5.2、Claude 4.5、Gemini 3 随便用
作为一名常年跑新模型、做选型评测的产品经理,如果只把 LMArena 视为一个查看“公开模型对比平台”,那你就错了。
普通用户可以在这里薅羊毛。
你可以免费体验 GPT-5.2、Gemini 3 Pro、C…
盘点4个AI大模型评测榜单网站,2026最全 AI 大模型选型榜单参考指南,建议收藏!
最近这半年,各大模型厂商密集发布新版本,从OpenAI、Anthropic到国内的GLM、Qwen,新模型层出不穷。
问题随之而来:这些模型到底处于什么水平?性能、成本、推理速度如何权衡?
如果你也有过这样的困惑,比如GLM 4.7发布后不…