《人工智能辅助的数字媒体创作》· 第三章
引言:当视频创作的门槛轰然倒塌
2024年2月,OpenAI发布Sora的那一刻,整个视频行业的气压都变了。一段提示词生成60秒高清视频——在过去,这需要一支专业团队、昂贵设备和数周时间。AI视频生成不是渐进式改良,而是一次断层式跃迁。这一章,我们将拆解AI如何让视频创作从少数人的事业变成所有人的表达方式。
第一节:人工智能与视频的关系
视频——最复杂的内容形态
如果说图像是空间的静态切片,那么视频就是空间×时间的四维艺术。每一帧不仅自身要合理,帧与帧之间还要保持时序一致性——人物不能突然变形、光影不能乱跳、运动轨迹必须符合物理规律。
技术演进路线
图像拼接时代(2022):逐帧生成图像后拼接,画面抖动严重。
时空扩散模型(2023-2024):在3D潜空间进行扩散,Runway Gen-2、Pika具有基本时序一致性。
DiT架构(2024-至今):Sora采用的Diffusion Transformer,将视频切分为时空块,实现长达60秒的连贯生成。
第二节:如何使用AI生成和编辑视频
主流工具矩阵
AI视频编辑的六种范式
文生视频:输入文本生成完整视频
图生视频:上传图片让AI赋予动态
风格迁移:将实拍视频转为特定艺术风格
智能补帧:AI插值提升流畅度
自动剪辑:AI分析视频自动提取精彩片段
数字人播报:AI生成虚拟主播(HeyGen)
实战流程:从概念到成片
Step 1:剧本/分镜 — ChatGPT辅助构思
Step 2:生成素材 — Midjourney关键帧+Runway转动态
Step 3:AI配音 — ElevenLabs旁白+Suno BGM
Step 4:后期合成 — 剪映AI自动剪辑+字幕
课程思政:AI与文化话语权
短视频正成为最有力的文化载体。AI视频工具降低了高质量内容的生产成本,为中国文化的全球传播提供了前所未有的机遇。用AI将《山海经》异兽呈现为电影级视觉奇观,将敦煌壁画复活为流动叙事,中国文化的话语权将得到实质提升。同时必须警惕深度伪造的伦理风险,坚守不制造虚假信息、不侵犯肖像权的底线。
本章小结
AI视频已从帧拼接进化到时空扩散+DiT架构
六大视频编辑范式覆盖创作全链路
实战创作=AI剧本+AI图像+AI视频+AI配音+AI剪辑
AI视频是中国文化全球传播的战略性工具
课后练习:用Runway或可灵创作一段30秒视频。
下一篇预告:第四章 · AI三维模型生成——从平面到立体的跨越
作者:AIGC研究者与教育者 | 2026年6月