上海AI实验室“书生·筑梦”视频大模型:从分钟级故事生成到筑梦 2.0 一体化视频生成

2026-9-20 14:23| 发布者: 坤哥| 查看: 2| 评论: 0|原作者: 坤哥|来自: hbsi.net

摘要: 上海人工智能实验室推出“书生·筑梦”(Intern·Vchitect)视频生成大模型,是首个支持故事性、多镜头的开源视频大模型,把 AI 生成视频从秒级提升到分钟级,并助力央视制作国内首部 AI 动画片《千秋诗颂》;新一代“书生·筑梦 2.0”进一步实现文生/图生视频、插帧超分与训练系统一体化。

一、书生·筑梦 1.0:首个支持故事性、多镜头的开源视频大模型

书生·筑梦是上海人工智能实验室“书生”家族中面向视频生成的代表,是首个支持故事性、多镜头的视频生成大模型,参数规模超过 30 亿,可依据提示词生成有故事性、含多镜头的分钟级视频,具备“转场流畅、故事连贯、画质高清”特点,已开源并提供免费商用。

它与 AnimateDiff 等文生视频框架、可控图像生成与图像驱动技术结合,在动画片等视频领域有广阔前景;用相关框架制作的 AI 视频曾亮相 2024 年央视春晚歌曲《枕着光的她》的动画背景。

2024 年 2 月,书生·筑梦助力中央广播电视总台制作国内首部 AI 动画片《千秋诗颂》,并于 2 月 26 日起在 CCTV-1 播出。实验室与总台此前已联合发布“央视听媒体大模型”,融合书生·浦语与书生·筑梦等能力,覆盖新闻助手、数字人、文生视频、动画制作等功能板块。

二、书生·筑梦 2.0:一体化视频生成与增强

书生·筑梦 2.0(Vchitect 2.0)集文生视频、图生视频、插帧超分、训练系统于一体,支持 5s–20s 长视频生成与多种画幅比例,采用扩散式 Transformer(DiT)架构。

同步开源的视频增强模型 VEnhancer 集成插帧、超分与修复,可在 2K/24fps 提升画质;评测框架 VBench 也升级为支持长视频生成评测。其开源 2B 模型性能可媲美开源最优 5B 模型,并开源 LiteGen 训练/推理框架,借助 Activation Offload 与 Sequence Parallel 优化显存与序列长度,支撑分钟级视频生成训练。

三、书生家族的多模态版图

除视频外,书生体系还涵盖科学多模态大模型 Intern-S、具身全栈引擎 Intern-Robotics、SafeWork 安全技术栈等,形成覆盖语言、视觉、视频、科学、具身与安全的开源大模型矩阵。

小结

书生·筑梦以“开源 + 免费商用”策略,把视频生成能力开放给创作者与产业,是新型研发机构推动生成式 AI 普惠的又一代表。

最新评论

关注公众号
手机版|小黑屋|联系站长|帮助中心| 河北软件学院门户网

相关侵权、举报、投诉及建议等,请发 E-mail:kuns@126.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

关注公众号
QQ客服返回顶部