跳到主要内容

生成式媒体:图像、音频与视频 AI

入门

AILmanac 的大部分内容都在讲会写作、会推理的 AI——像 Claude 这样的文本模型。但 AI 还有另一个完全不同的分支:从提示词生成媒体——图片、视频、语音和音乐。本页是这个领域的一张中立于厂商的地图:各种原型、值得关注的工具(每一个都经过验证确实存在)、它们与文本 LLM 的区别、可以迁移的技能,以及你无法跳过的权利与伦理规则。

What you'll learn
  • 了解生成式媒体的主要原型——图像、视频、语音/音乐、语音转文本——以及每一类中的一个真实工具
  • 理解媒体模型与 Claude 这样的文本对话模型有何不同
  • 学习可迁移的技能:媒体提示词、迭代和参考输入
  • 尊重不可协商的底线:使用权、来源/水印,以及深度伪造/知情同意的伦理问题

媒体模型与文本 LLM 有何不同

如果你只用过对话模型,有四点区别很重要:

  • 输出不同,"正确"的含义也不同。 文本模型返回一个基本确定的最佳答案。而媒体模型返回一个成品(一张图、一段片段、一段配音),其中没有唯一正确的答案——只有你更喜欢或更不喜欢的。你要生成好几个再挑选。
  • 通常你无法只靠改提示词来编辑输出。 改动一个词就可能改变整张图。真正的控制来自参考输入(起始图像、风格图像、参考音色)加上工具特有的控制项,而不只是文字。
  • 随机种子和变体是工作流的一部分。 许多工具允许你重新生成、生成变体或锁定"种子"以实现可复现。迭代是常态,不是失败。
  • 计费单位不同。 文本按 token 计费;媒体按每张图、每秒视频、或每字符/每分钟音频计费——尤其是视频,很快就会变得很贵。
Pro tip
  • 心智模型:文本模型是一位直接给你答案的作家;媒体模型是一台带方向盘的老虎机——你先拉杆,再用参考输入和重新生成来调整方向,直到对为止。
  • 批量生成再筛选。你的品味——知道 4 个输出里哪个最好——是这门技能的一半。

地图:原型与值得关注的工具

要用原型来思考——阵容不断洗牌,但类别是稳定的。下面提到的每个工具都经过验证确实存在,并附有真实 URL(在"来源"中);具体版本刻意留得模糊,因为它们变化太频繁。

图像生成(文本生成图像)

把一段文字提示词——以及可选的参考图像——变成一张静态图片。

  • Midjourney —— 闭源、托管式;以强烈的默认美学和风格/参考控制而闻名。
  • OpenAI 图像生成(DALL·E / GPT Image 系列)—— 闭源、托管式;与 ChatGPT 和 API 紧密集成。
  • Google 的 Gemini 图像生成("Nano Banana")和 Imagen —— 闭源、托管式;接入了 Gemini 和 Google Cloud。
  • Adobe Firefly —— 闭源、托管式;为创意工作流打造,训练时考虑到了商业用途(见下文的权利部分)。
  • Stable Diffusion(Stability AI)和 FLUX(Black Forest Labs)—— 你可以下载并自行运行的开放权重模型系列,是本地/开放图像生态的支柱。

视频生成(文本/图像生成视频)

从提示词或起始图像生成短片段——并且越来越多地带有同步音频。

  • OpenAI Sora —— 一个前沿视频模型(注意:独立的消费级应用已停用;模型通过 API 延续下来——这是"版本/可用性会过时"的经典例子)。
  • Google Veo —— 前沿视频,近期版本带有原生音频。
  • Runway —— 围绕其 Gen 系列视频模型打造的创意套件。
  • Kling(快手出品)和 Pika —— 发展迅速的视频工具,在社交/短视频内容上很受欢迎。

语音、演说与音乐(音频)

  • ElevenLabs —— 闭源、托管式;逼真的文本转语音和语音工具(语音克隆牵涉到真实的知情同意问题——见伦理部分)。
  • SunoUdio —— 从一段文字提示词生成完整歌曲(人声 + 配器)。
  • OpenAI Whisper —— 反方向的:语音转文本(转录)。它是开放权重的(MIT 许可),所以你可以自行运行或调用托管 API。语音转文本是字幕、语音笔记和会议记录背后默默无闻的主力。
Pro tip
  • 最大的一个分叉(和文本模型一样):闭源托管工具(往往质量最好、配置最少)对比像 Stable Diffusion、FLUX 和 Whisper 这样的开放权重模型,后者可以自行部署,以获得隐私、控制权和大规模下更低的成本。
  • 不要凭排行榜选。对于你真正想要的画面/声音,在 2-3 个工具里各生成几个真实样例,用自己的眼睛和耳朵去判断。

如何从媒体模型得到好结果

这个工作流更像一次摄影拍摄,而不是一次 Google 搜索。以下步骤与具体工具无关:

Guided walkthrough1 of 6
  1. 以主要主体开头,然后加上场景、动作和氛围。'一只红狐狸'很弱;'一只红狐狸蜷缩着睡在新雪中,柔和的晨光'才给了模型可以发挥的东西。

图像生成提示词示例(媒介 → 主体 → 风格 → 细节)

A cinematic wide-angle photograph of a lighthouse on a rocky cliff
at golden hour, waves crashing below, dramatic storm clouds parting.
Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field.
Mood: hopeful, epic. Aspect ratio 16:9.

Tip: if the result is close, change ONE element next pass
(e.g. "blue hour" instead of "golden hour") and re-roll —
or add a reference image to lock the look.

权利、来源与伦理——不可协商的底线

媒体 AI 引出了文本对话通常不会碰到的问题。请把这些当作工作的一部分,而不是事后补救。

使用权与商业权利。 每个工具都有自己的许可,而且差异很大。有些限制商业用途,有些只在付费档位授予,而且输出可能类似受版权或商标保护的作品。以 Adobe Firefly 为例,它依赖的是出于商业安全考虑而挑选的训练数据——但你仍然应该去读你所用工具和档位的实际许可条款,而不是想当然。

来源与水印。 一项日益普及的标准,C2PA / Content Credentials,会附加防篡改的"营养标签"式元数据,记录一件成品是如何制作和编辑的。如今许多主流图像和视频工具都嵌入了它。请保持来源信息完整,并优先选择支持它的工具——它正在成为可信媒体的常态。

深度伪造、声音与知情同意。 逼真的人脸和语音生成可以冒充真实的人。未经明确同意,不要克隆某人的声音或肖像;绝不要用生成的媒体去欺骗;并遵守你所在司法辖区的法律。语音克隆的同意和 AI 生成内容的披露不只是礼仪——它们越来越多地成为法律要求。

Watch out
  • 生成的媒体可能带有使用权限制和深度伪造/知情同意风险——请检查每个工具的许可,并披露 AI 生成的内容。

从你的文本 AI 技能里能迁移什么

好消息:你已经掌握的很多东西都能迁移过来。

  • 清晰、具体的提示词 —— 在任何模态下,具体说明你想要什么都胜过含糊的愿望。
  • 迭代胜过一次成型 —— 你和 Claude 一起用的那套"起草、批评、精修"循环同样适用,只是把追问消息换成了重新生成和参考图像。见 提示词基础
  • 为任务选对工具 —— 选择模型 那套框架(先看约束条件,再做一个微小的真实世界测试)用在媒体上同样奏效。
  • 理解模型究竟是什么 —— 明白这些是模式学习者、而非魔法,能让你的预期和伦理都保持端正。见 基础

自我检测

自我检测

0/4
  1. 除了文字之外,控制媒体模型输出观感最可靠的方式是什么?
  2. 以下哪一个是你可以下载并自行运行的开放权重工具?
  3. C2PA / Content Credentials 是什么?
  4. 在把 AI 生成的媒体用于商业用途之前,最稳妥的做法是:

记忆卡片

按 Enter 或空格键翻转卡片。使用左右方向键在卡片之间切换。已显示术语。
1 / 6
Key takeaways
  • 生成式媒体是与文本对话不同的 AI 分支:它生成图像、视频、语音和音乐,而你要靠参考输入和重新生成来引导它,而不只是文字。
  • 用原型来思考——图像、视频、语音/音乐、语音转文本——并记住闭源对开放权重的那个分叉(例如 Midjourney 对 Stable Diffusion/FLUX;托管 TTS 对开放的 Whisper)。
  • 可迁移的技能从文本 AI 沿用过来:具体的提示词、迭代,以及为任务选对工具。
  • 权利和伦理是工作的一部分:检查你所用工具和档位的许可,保留来源信息(C2PA/Content Credentials),为声音/肖像获取同意,并披露 AI 生成的媒体。
  • 具体细节很快就会过时——在依赖之前,对照各工具自己的页面核实版本、价格和能力。

来源与延伸阅读