精华速览
2025年9月15日,智象(HiDream.ai)发布原生全模态音视频生成模型HiDream-O1-Video-1.0(HiDream V1),其图生视频能力在Artificial Analysis排名第4、Arena.ai排名第8,双榜进入全球前十。该模型主打多模态意图理解、按内容自规划时长(原生支持5—20秒)以及物理规律建模,实测在拧螺丝、NBA绝杀、百米飞人大战等场景中表现稳定。随着视频能力落地,智象围绕UiT统一底座构建的图像、视频、3D、具身四大模型矩阵完成闭环,成为全球视频生成头部竞争中少见的创业公司玩家。
要点透视
- 2025年9月15日,智象发布HiDream V1,图生视频能力在Artificial Analysis排名第4、Arena.ai排名第8,双榜进入全球前十。
- HiDream V1原生支持5—20秒任意时长生成,时长由模型根据事件展开、动作完成和叙事节奏自行规划,而非固定参数预设。
- 模型采用“先规划、后联合生成、再以多模态Reward对齐”的技术思路,后训练阶段使用Diffusion RL,并有多模态Reward模型与人工认知对齐。
- 支撑研发的DMSampler、DiffusionCompass、EvoID三篇论文分别被2026年ICML、ECCV、CVPR收录,覆盖扩散强化学习采样效率、生成质量控制和身份保持方向。
- 智象四大模型共享UiT统一底座:图像模型HiDream-O1-Image商用版1.5在Artificial Analysis文生图榜获中国第一、全球第三;世界模型HiDream-O1-World在WBench的Navi分榜以80.9分位列第一;具身模型HiDream-O1-Embodied在RoboColiseum的Robustness子榜以0.692分登顶。
- 2025年7月31日Seedance2.5与MiniMax H3同日发布,8月阿里发布Wan3.0,9月智象HiDream V1发布,两个月内多家中国厂商密集推出新一代视频生成模型。
- 实测中,HiDream V1在残缺歌词输入下自动补全“低音轰进胸口”,并实现口型与歌词同步;在百米飞人大战场景中生成8名运动员起跑至冲刺的完整过程,未出现明显肢体穿模。
文章拆解
HiDream V1的发布放在2025年下半年的行业节奏中看,意义不止于单一模型上新。7月底Seedance2.5与MiniMax H3同日发布,8月阿里Wan3.0落地,9月智象HiDream V1跟进,中国视频生成模型在两个月内形成密集迭代,并在全球主流榜单头部从“单点领先”转向“多家并进”。智象作为创业公司进入这一区间,说明头部牌桌上开始出现大厂和上市企业之外的新玩家。
从技术路线看,HiDream V1的差异化集中在三点:一是生成前先做多模态意图理解与结构化规划,把口语化、模糊的输入拆解为人物、动作、镜头、光影、台词、声音等可执行分镜;二是时长由内容决定而非提示词预设,避免为凑时长强行加戏;三是强化物理规律建模,让碰撞、惯性、光影衰减和空间连续性在生成中保持合理。这三点的共同指向,是视频生成从“按提示词出画面”转向“理解意图后组织完整镜头”,也是其被归入世界模型路径的原因。
对行业和用户而言,最直接的影响是专业提示词门槛可能下降。普通用户用一句口语加一张参考图,就有机会获得叙事完整、音画同步的短视频,这对影视预演、广告素材、电商展示等生产场景具有实际价值。同时,物理规律建模能力提升后,视频模型与3D交互、具身智能之间的能力边界正在模糊,智象以UiT统一底座串联图像、视频、3D、具身四条线,正是这一趋势的体系化表达。
值得关注的变量有三。其一,榜单排名与真实生产可用性之间仍有距离,实测中NBA绝杀场景末尾出现了人物位置偏移,说明长时序空间一致性尚未完全解决。其二,原生全模态联合生成对算力与数据的要求较高,创业公司能否在持续迭代中保持节奏,尚待确认。其三,视频生成涉及版权、肖像与内容安全,模型对真实人物和赛事场景的生成能力越强,合规压力也越大。整体来看,HiDream V1让智象的世界模型矩阵完成闭环,但视频生成走向稳定可用的生产工具,仍需观察后续版本在一致性、可控性和成本上的表现。

暂无评论。