#LLM
模型如何获得更好的推理表现:8 种测试时计算机制详解
让大语言模型(LLM)获得更强推理表现的方法,主要可以归为两类:
并行扩展(parallel scaling):对同一个提示多次采样,再从多个候选结果中进行选择。
顺序扩展(sequential scaling):在给出最终答案前,延长单…
AirLLM:4GB 显存跑 70B 大模型的逐层加载推理方案
之前通过 Ollama、SGLang 在本地部署过大模型的朋友都知道,受限于显卡显存,基本上只能部署小参数且量化后的模型。
这些模型在本地跑基本是残血状态,拿来玩玩还可以,但效果往往差强人意。
最近在 GitHub 上发现一个 3 万 St…
Hallmark:2.1万Star的AI编程Skill,57道检测关卡告别AI味前端页面设计
用 Claude Code、Codex 等 AI 工具写前端页面,对任何人来说几乎没有了门槛。
只需简单一句话描述需求,几分钟就能拿到一个完整且能部署运行的页面。
但这些页面基本一个样:紫色渐变大标题、所有元素居中、三列圆角图标大卡片。
大…
Hallmark:2 万 Star 的 AI 网页设计 Skill,内置 57 道反套路检测
用 AI 生成网页时,最大的挑战不是实现不了,而是做出来一看就是「AI 做的」。紫青渐变、居中标题按钮、三等分功能卡片——这些元素单独看都没有问题,但组合在一起就变成了 AI 页面的标准模板。更麻烦的是,即使反复修改…
ai-agent-book:12K Star 的开源 AI Agent 全书,从原理到工程实践
前阵子一个做后端的朋友被老板安排带队搞 AI Agent 项目。他 Java 写了八年,LLM 调用过几次,但要设计一个生产级 Agent 系统,脑子里一片空白。"Agent 到底是什么?不就是 LLM 加工具调用吗?那跟之前调 API 有…
Awesome LLM Apps:100+可运行AI Agent模板,克隆就能用
想做一个 AI Agent,搜了一堆资料,打开十几个标签页,每个都在讲概念。RAG 是什么意思,Agent 的 ReAct 循环怎么设计,MCP 协议又是什么鬼。看了一小时,代码一行没写。
然后你找到了一个 GitHub 仓库:Awesom…
SGLang 团队把工程经验写进 Agent:3 个 Kernel PR 合并,B200 加速 2.75x
Agent 辅助开发:SGLang 团队的工程实践
SGLang 团队最近做了一件有趣的事:把自家在 benchmarking、profiling、CUDA kernel 调优、生产问题排查等方面的工程经验,编码成可执行的 agent sk…
DeepSeek 开源 DSpark 推理加速框架:V4 生产环境提速最高 85%
DeepSeek 刚刚开源了一套全新的推理优化方案 DSpark,附带详细论文、草稿模型权重以及完整的训练框架 DeepSpec。在 DeepSeek V4 生产环境中的实测结果显示,吞吐量和延迟提升了最高 85%—&mdash…
构建 AI 时代的知识底座:LLM Wiki 编译流水线实践
领域知识决定了 AI 在业务中能发挥多大的价值。任何 AI 系统都由模型、知识、架构三部分组成——模型由供应商提供,架构常因模型升级而失效重做,只有领域知识只能从内部积累,不可替代且持续变化,是最值得长期投入的部分。…
谷歌 Gemma 4 12B 实测:原生音频理解+256K 上下文,普通笔记本可运行
如果你一直觉得本地大模型"要么太笨,要么跑不动",谷歌这次的 Gemma 4 12B 很可能直接打破这个印象。
它不仅能看图说话,还首次在中型模型中加入了原生音频理解——直接"听懂"录音、视频里的声音,无需额外接语音…