10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

GLM 5.3 实测:750B 参数后训练逼平 GPT-5.6,复杂编码与安全能力全面评测

5小时前 AI最新动态 26 0

GLM5.3 API上线了,昨天又充值了GLM Coding Plan。

5.3的定位很直接,擅长复杂编码,长程Agent任务,加上防御性网络安全。

AA榜成绩也出来了,GLM-5.3拿到60分,也是进了前十。60分及以上的模型一共六个,GLM-5.3体量大概750B,是里面最小的。Kimi K3约2.8T,Grok 4.6约1.5T,Eigenigma用IKP(Incompressible Knowledge Probes,不可压缩知识探针)方法预估GPT 5.6 sol和Claude Opus5的参数可能是1.99T和2.1T。

图片 1

5.3没有选择堆叠参数,和GLM-5.2用的是同一个基础模型。

就做了后训练,分数就这么水灵灵提升上来了,我把技术报告和唐杰老师发的帖子用简单几句话来总结一下,我们平时聊AI变强,默认想到的都是把模型做大,喂更多数据。但是Scaling不应该只关注参数量。GLM5.3这次的提升更像一次控制实验。

Kaplan(优先把模型参数做大)到Chinchilla(同样算力下,模型和数据应该一起涨)说明了参数和数据之间不存在永恒不变的比例;加上大规模推理成本后,最优解又会进一步转向更小训练更充分的模型;MoE(混合专家)让模型参数量分裂为总容量,激活计算和有效深度等多个维度,不同维度的作用并不相同。

Scaling应该是对模型全生命周期的算力进行重新配置。这次智谱选择了后训练,因为剩余的空间最大。

图片 2

离谱的是,GLM5.3定价还跟上一代一样保持不变,下周还开源,

卷王之王啊。。。

OK,直接先说结论,这次GLM5.3重回我国产模型top1,我称之为额度救星级。

这次改了一下测Coding模型的标准。过去测Coding模型,很多时候看的是第一屏,页面出来了,动画有了,按钮能点,OK结束。拉开差距的是第二轮、第三轮,甚至第十轮的表现,如果我说这个交互动画不对,模型会不会记得原来的设计意图。我说状态管理有bug,它会不会准确定位。

正式开跑Case之前,我先拿GLM-5.3做了点别的。

自从开源了Goodcase .ai,最近case数已经涨到700+了,访问量也上了7天2万。我都是从里面随机抽cases批量测的。但这次随机抽Case之前,我先把最近大家对Goodcase提的一些意见和文档都看了遍,把一个我有点没看懂的问题丢给5.3做了。

图片 3

说实话,我一开始其实没怎么看得懂,说这个容易变脸是什么意思?

能看出来,5.3对源代码的改动不是那种大刀阔斧的重做,反而关注在比较偏细节层面的整理,一开始我是让模型在收录的时候按照展示尺寸裁剪图片,这样确实会有一部分的信息损失,换了新的资产模式之后可以切换图片来查看同一个提示语跑出来的多个结果,

图片 4

还能点击放大查看。

图片 5

那我们开测下一个case,文生3D游戏!

不加规则,不给参考实现,也不提前告诉它页面该长什么样。就给GLM-5.3一句话,看它自己能补到什么程度。素材还是从GoodCase .ai里面找的,

这次挑了一个之前已经用GPT做过的交通模拟效果。

write a python code that visualizes how a traffic light works in a one way street with cars entering at random rate.没有UI规范,没有告诉它红绿灯怎么切,也没规定车辆怎么移动。

第一次跑完,整体结构和方向就已经出来了。车随机频率出现,速度有明显变化,遇到红灯会停下来。没出现突然穿车或者整个模拟跑崩的情况。

我跟deepseek v4 pro + deepseek harness标准模式做了一把对比,

质量差不多的情况下,glm5.3的生成速度比ds的12分钟快了两倍左右。

功能有了,但视觉上还偏Demo感,离GoodCase里原本那个效果还有距离。

所以第二轮我基本只补了一句话。

Keep the existing traffic simulation logic, but refine the UI and visual quality to make it feel more polished and closer to a finished product.主要交互逻辑没被改坏,整体视觉质感明显又往前走了一步。

这把同样也是用deepseek v4 pro跑了,

可以看到,到了补UI的阶段。GLM-5.3这个UI的精致程度就拉出来差距了,包括它的背景,包括它还给每辆小车追加了大灯,因为是晚上,刹车的时候还会出现尾灯,细节拉满。

除了复杂编码,5.3这次还重点提升了安全能力,甚至还把他们解决过的漏洞都公开出来了。

发布前两周联合安全团队发现了2404个漏洞,其中1088个属于中高危,最早可以追溯到大约40年前,涉及Android、Windows、macOS和常用App等软件生态。

图片 6

拿了一个我以前真实踩过的坑。

上周折腾Mac测试项目的时候,用了一个叫Ice的菜单栏管理工具。到现在还是噩梦。不知道哪里出了问题,装上之后就把我一些菜单栏图标藏掉了,特别是codex的,还是找不到的那种。。。

这次直接报仇。

把Ice的源代码交给GLM-5.3,让它不要只看表面现象,从代码里面把和菜单栏隐藏、状态恢复相关的逻辑完整查一遍。原本以为这种问题会比较难找,或者没法根除,因为之前真的测到放弃了。。

GLM-5.3真的很快就把问题范围缩了下来。

一路追到了Ice实际隐藏图标的机制,菜单栏状态恢复逻辑,以及对macOS私有API和模拟拖拽事件的依赖。

图片 7

离谱的是,它还主动去对照了项目自己的文档和GitHub Issues,找到了和我遇到现象高度一致的上游问题,再把外部线索和本地源码对应起来。

图片 8

最后给出来的是一条完整的问题链。

现象是什么,为什么会发生,哪段代码负责,为什么新版macOS更容易触发,现在怎么恢复,代码层面应该怎么修。

它甚至还顺手做了一轮安全审查,把私有API、Accessibility、屏幕录制权限,以及一个会强制终止其他菜单栏App的高风险行为单独列了出来。同时也明确区分了,哪些是真正的安全风险,哪些只是兼容性或设计缺陷。

图片 9

同样的提示语丢给我现在用的Grok 4.6找找漏洞,没用gpt 5.6是因为额度完全没有了。。。

同样是找漏洞,Grok 的习惯更多像是去找替代品,以及如何去修复应用给系统带来的问题。

简单来说,它跟 5.3 不一样的是,它没有去研究这个代码怎么改,而是直接给了我一个修复方案,怎么在 macOS 里重新把我的 logo 显示出来,以及给了一个ice作者在 issue 上提到的分支修改。

图片 10

所以对比下来,5.3的表现效果更好,因为它给出了软件本身的修复方案。Grok反而是倾向于让我改电脑环境配置、把程序删掉换个替代品,而不是去修复。

继续继续,我决定直接把难度往上拉。

这次不再让5.3自由发挥了开始定规则。让它复刻一个我以前4399很沉迷的2D节奏跑酷游戏。直接让它把角色移动,跳跃,音效,特效这些东西全部加进去,看看GLM-5.3面对一个真正需要实时状态不断变化的项目,到底还能不能hold得住。

一共出了三个不同主题的关卡,自己的Canvas渲染器,角色移动和碰撞逻辑。

实际跑起来之后,我觉得它的完成度还是要比我原本预期的还要高不少。

首先是那个手感,居然真的有一点像。角色起跳的时候有对应的跳跃音效,撞击,死亡和一些场景元素也都有反馈。再加上背景,障碍物和前景之间的空间层次,以及镜头跟着角色高速往前推进的感觉,整个游戏跑起来的时候,不会只是几个方块在Canvas上移动。

这个方块跳起来,有点像是有物理引擎的样子的,撞到物体会变形,跳起来也会变形,撞到尖锐的物品上还会爆开。真的跟我童年玩的版本非常非常接近了。挂掉之后可以马上重新开始,不会因为一堆页面切换把节奏打断。镜头跟随也比我想象中稳,角色高速往前跑的时候,基本不会突然被甩到屏幕边缘。

就是有一个难点,我连第一关都过不了,直接差评。

那还是按照惯例,用字节的Seed-Evolving跑一个同款case对比一下效果,

可以很明显看到,这两次做游戏类的时候,GLM-5.3都有注重加强游戏背景,游戏实体的互动性会更多,主要是单个实体的互动。就像这个关卡对应的球体用的是seed做的是发光球体,而不是像5.3用的是弹性球体。

搞完2D,继续搞3D。

还是一个童年小游戏,愤怒的小鸟。

不过大家熟悉的都是2D版本,所以这一次我故意换了个玩法,

让GLM-5.3把它重新做成一个3D游戏。

我也挺好奇,同样是弹弓,鸟,建筑和猪,整个东西放到3D空间里面之后,它到底会怎么理解。

这一轮确实烧得有点久。。。我一晚上直接烧完了20%周额度。

图片 11

越往后跑越慢,中间一度让我怀疑是不是给它上太大强度了……

但最后结果真正出来的时候,还是挺有意思的。这确实是一个我以前没有见过别的模型做过的3D愤怒的小鸟。

游戏一共做了三个关卡,也补上了自己的音效,弹射,碰撞和关卡流程。实际玩下来,基本玩法都能正常跑,鸟可以拉动,发射,撞到建筑之后也会有对应的物理反馈。

整体完成度其实比我预想中高。

只发现一个比较明显的Bug,射完一只鸟之后,有时候弹弓会直接空掉,下一只鸟没有正确补上来。

图片 12

同样的case我还在Kimi K3上跑了一遍,

我的预感就是这个3D版愤怒的小鸟说不定还能再火一把,因为它的打击感真的是非常明显,非常好玩。K3和GLM 5.3分别选择了两种不一样的物品消失方式,5.3是鸟击破物体之后,物体会呈粉末状爆破消失,K3是有点延迟物体掉地上后爆开。硬要说有什么区别的话,K3设计的关卡数量没有5.3那么多。

最后一个任务,我做一个音乐工作台,Cadence。

原因其实很简单,一直很喜欢Spotify那种音乐工作台的感觉,但又又又不想为了UI充会员。所以我就想,干脆做一个自己的音乐软件。以后自己的音乐可以直接放进去,界面,交互,操作方式也全部按照我自己喜欢的来。

于是我把自己的需求整理成Prompt,直接丢给了5.3,

Listening,Library,Album,Playlist感觉我没想到的他都注意了,包括不同页面之间的层级和整体视觉质感,第一次生成的时候基本就已经出来了。

它甚至没有简单拿一堆完全一样的Placeholder把页面填满。不同专辑,歌曲,封面和内容之间都有一些变化,第一眼看过去没有那种很明显的AI页面感。

先给自己挖一个坑,说不定之后会开源一个本地AI音乐播放器出来玩玩。

6个case跑完了,

这些效果都是在同一个750B的基座上发生的,也是同分段参数最小的一个。

所以还是由智谱训出来的GLM才对味。

5.3出来之前,我还见过很多用5.2版本继续训练出来的模型,但5.3用后训练Scaling这条路证明了一件事。

我们不需要永远追着做更大的基座。

当环境够真实,奖励够抗打,系统够灵活的时候,

就算参数量只有同分段的1/4,

750B也能往上走很远更远。

这是一种我在做我自己认为对的事的笃定。

有点期待GLM下版本会有什么惊喜了。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:GLM 5.3 实测:750B 参数后训练逼平 GPT-5.6,复杂编码与安全能力全面评测
#GLM 5.3 # 智谱AI # 大模型评测 # AI编程 # 后训练Scaling 
收藏 1
Claude Code 和 Codex 作为 DeepSeek Harness 子 Agent 实战:几分钟上手部署教程
腾讯开源 teamai-cli:用 Git 驱动团队 AI 协作,打通 20+ 主流 AI 编程工具
推荐阅读
  • Hermes 接入 Kimi K2.6 实测:SOTA 代码能力深度评测,不限流但推理速度慢
  • 小红书上线Skill挂载功能,AI创作者变现新通道开启
  • Anthropic 内部管理分享:高 Agency 与高 Accountability 如何共存
  • 学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
  • Meta 发布全新大模型 Muse Spark:多模态是强项,编程是短板
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
33444 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29910 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
22969 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22087 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
19411 4月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18187 4月前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17941 1年前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
17675 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
17556 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16157 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 GLM 5.3 实测:750B 参数后训练逼平 GPT-5.6,复杂编码与安全能力全面评测
2 豆包桌面端工作任务升级:支持 GUI 操作电脑、飞书妙搭应用生成与画中画模式
3 Grok 4.6 发布:性能对标 GPT-5.6 Sol,API 定价性价比更高
4 DeepSeek Harness 插件生态:三天 112k Star,同事蒸馏和跨平台内容搜索火了
5 智谱ZCode 3.0升级:面向GLM-5.2深度优化,缓存命中率98%,限时额度1.5倍
6 DeepSeek 官宣 API 整体涨价:免费 Token 时代倒计时,开发者如何应对
7 MiniMax-H3-Turbo-Lora:8 步推理加速视频生成,质量不输原生 20 步
8 DeepSeek V4 Flash 内置联网搜索:Responses API 原生支持 web_search,Codex 可直接调用
9 GPT-5.6 更新:Luna 免费无限文本,Sol 统一付费 Chat 快答与深思
10 Cherry Studio V2.0 正式发布:从 AI 聊天客户端到 Agent 自主执行的全能工作站
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联