#多模态

MiniMax-H3 视频提示词写作教程:T2VA/I2VA/FL2VA/L2VA 四种任务全解析
你兴冲冲打开 MiniMax-H3,输入「一个女孩在雨中奔跑,画面唯美」,点了生成。 等了半分钟,视频出来了。镜头乱晃,女孩的脸走形,没有脚步声,没有雨声,背景音乐像从电梯里偷录的。 你关掉页面,心想:就这? 但问题大概率不在模型,在你的提…
SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑
今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线。如今商汤持续强化模型的图像生成与编辑能力,正式开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lit…
腾讯 Miora:AI 原生创意智能体工作室,五大专家 Agent 协同产出图片/视频/3D/UI
腾讯团队开源的 Miora(miora.design,中文名"设计妙境")是一款 AI 原生创意智能体工作室。与 WorkBuddy 同源架构,但定位明确——WorkBuddy 帮你干活,Miora 帮你出图、出视频…
Meta Muse Image 发布:首个 Agent 生图模型,支持写代码查资料和自主修正
Meta 旗下的超智能实验室 Meta Superintelligence Labs 推出了图像生成模型 Muse Image,并同步预览了 Muse Video。Muse Image 的核心创新在于引入了智能体(Agent)机制,不再单纯…
claude-video 开源工具:让 Claude 真正看懂视频的多模态方案
以前想让 Claude 看视频,基本只能靠猜。要么从标题推断,要么拉个字幕文本丢给它,但字幕经常少 90% 的屏幕内容。即使把视频链接给 Claude,它也会说"我不能看视频"。 GitHub 上刚开源的 claude-video(4200…
字节 Seed-Audio 1.0 实测:从语音合成到语音创作的突破
字节的多模态模型,这水准真的没得说。早上体验了他们新发的豆包音频生成模型 Seed-Audio 1.0,结果不废话,先看一个具体的 Case。 让它以杜甫的口吻吟诵《闻官军收河南河北》。声音表现、情绪起伏和声场氛围,全部是一个 Prompt…
谷歌 Gemma 4 12B 实测:原生音频理解+256K 上下文,普通笔记本可运行
如果你一直觉得本地大模型"要么太笨,要么跑不动",谷歌这次的 Gemma 4 12B 很可能直接打破这个印象。 它不仅能看图说话,还首次在中型模型中加入了原生音频理解——直接"听懂"录音、视频里的声音,无需额外接语音…
AudioX-Turbo 开源音频生成模型:4 步极速出音效,支持文本/视频多模态输入
这个视频中,风刮玻璃、狂野感的森林环境音和鸟叫声、火球发射后爆炸声、布鞋踩在松软草原的脚步声——这些一系列场景的配音都是 AI 生成的。 今天要推荐的开源语音大模型 AudioX-Turbo,能把视频场景直接转成…
Qwen3.7-Plus正式上线:阿里最强多模态智能体模型,限时8折
阿里云百炼平台正式宣布:Qwen3.7-Plus 正式上线。作为千问 3.7 系列的重要成员,Qwen3.7-Plus 被官方定义为"能看、能想、能动手的多模态智能体模型",在编程、办公自动化与长周期任务自主执行方面全面进阶。 Qwen3.…
Step 3.7 Flash 实测:Agent 时代的高效多模态模型,1 分钟完成 Web 项目开发
最近阶跃星辰发布了最新的 Step 3.7 Flash,一款面向 Agent、Coding、Search 与多模态工作流而生的高效率模型。这个定位确实有点反常识——毕竟此前的 Flash 版本默认是旗舰大哥的便宜替代…