生成式媒体:图像、音频与视频 AI
AILmanac 的大部分内容都在讲会写作、会推理的 AI——像 Claude 这样的文本模型。但 AI 还有另一个完全不同的分支:从提示词生成媒体——图片、视频、语音和音乐。本页是这个领域的一张中立于厂商的地图:各种原型、值得关注的工具(每一个都经过验证确实存在)、它们与文本 LLM 的区别、可以迁移的技能,以及你无法跳过的权利与伦理规则。
- 了解生成式媒体的主要原型——图像、视频、语音/音乐、语音转文本——以及每一类中的一个真实工具
- 理解媒体模型与 Claude 这样的文本对话模型有何不同
- 学习可迁移的技能:媒体提示词、迭代和参考输入
- 尊重不可协商的底线:使用权、来源/水印,以及深度伪造/知情同意的伦理问题
媒体模型与文本 LLM 有何不同
如果你只用过对话模型,有四点区别很重要:
- 输出不同,"正确"的含义也不同。 文本模型返回一个基本确定的最佳答案。而媒体模型返回一个成品(一张图、一段片段、一段配音),其中没有唯一正确的答案——只有你更喜欢或更不喜欢的。你要生成好几个再挑选。
- 通常你无法只靠改提示词来编辑输出。 改动一个词就可能改变整张图。真正的控制来自参考输入(起始图像、风格图像、参考音色)加上工具特有的控制项,而不只是文字。
- 随机种子和变体是工作流的一部分。 许多工具允许你重新生成、生成变体或锁定"种子"以实现可复现。迭代是常态,不是失败。
- 计费单位不同。 文本按 token 计费;媒体按每张图、每秒视频、或每字符/每分钟音频计费——尤其是视频,很快就会变得很贵。
- 心智模型:文本模型是一位直接给你答案的作家;媒体模型是一台带方向盘的老虎机——你先拉杆,再用参考输入和重新生成来调整方向,直到对为止。
- 批量生成再筛选。你的品味——知道 4 个输出里哪个最好——是这门技能的一半。
地图:原型与值得关注的工具
要用原型来思考——阵容不断洗牌,但类别是稳定的。下面提到的每个工具都经过验证确实存在,并附有真实 URL(在"来源"中);具体版本刻意留得模糊,因为它们变化太频繁。
图像生成(文本生成图像)
把一段文字提示词——以及可选的参考图像——变成一张静态图片。
- Midjourney —— 闭源、托管式;以强烈的默认美学和风格/参考控制而闻名。
- OpenAI 图像生成(DALL·E / GPT Image 系列)—— 闭源、托管式;与 ChatGPT 和 API 紧密集成。
- Google 的 Gemini 图像生成("Nano Banana")和 Imagen —— 闭源、托管式;接入了 Gemini 和 Google Cloud。
- Adobe Firefly —— 闭源、托管式;为创意工作流打造,训练时考虑到了商业用途(见下文的权利部分)。
- Stable Diffusion(Stability AI)和 FLUX(Black Forest Labs)—— 你可以下载并自行运行的开放权重模型系列,是本地/开放图像生态的支柱。
视频生成(文本/图像生成视频)
从提示词或起始图像生成短片段——并且越来越多地带有同步音频。
- OpenAI Sora —— 一个前沿视频模型(注意:独立的消费级应用已停用;模型通过 API 延续下来——这是"版本/可用性会过时"的经典例子)。
- Google Veo —— 前沿视频,近期版本带有原生音频。
- Runway —— 围绕其 Gen 系列视频模型打造的创意套件。
- Kling(快手出品)和 Pika —— 发展迅速的视频工具,在社交/短视频内容上很受欢迎。
语音、演说与音乐(音频)
- ElevenLabs —— 闭源、托管式;逼真的文本转语音和语音工具(语音克隆牵涉到真实的知情同意问题——见伦理部分)。
- Suno 和 Udio —— 从一段文字提示词生成完整歌曲(人声 + 配器)。
- OpenAI Whisper —— 反方向的:语音转文本(转录)。它是开放权重的(MIT 许可),所以你可以自行运行或调用托管 API。语音转文本是字幕、语音笔记和会议记录背后默默无闻的主力。
- 最大的一个分叉(和文本模型一样):闭源托管工具(往往质量最好、配置最少)对比像 Stable Diffusion、FLUX 和 Whisper 这样的开放权重模型,后者可以自行部署,以获得隐私、控制权和大规模下更低的成本。
- 不要凭排行榜选。对于你真正想要的画面/声音,在 2-3 个工具里各生成几个真实样例,用自己的眼睛和耳朵去判断。
如何从媒体模型得到好结果
这个工作流更像一次摄影拍摄,而不是一次 Google 搜索。以下步骤与具体工具无关:
- 以主要主体开头,然后加上场景、动作和氛围。'一只红狐狸'很弱;'一只红狐狸蜷缩着睡在新雪中,柔和的晨光'才给了模型可以发挥的东西。
- 说清这是哪一种图像/视频/语音:照片还是插画还是 3D 渲染;相机/镜头还是艺术风格;对于音频,则是流派、节奏和情绪基调。大部分观感都藏在风格里。
- 一张起始图像、一张风格参考图像,或一段参考音色片段,对结果的控制远比形容词更可靠。这正是只会用文字的人所忽略的、可迁移的技能。
- 生成若干变体。挑最接近的那个——你的品味是工具的一部分。别指望第一次生成就是最终留下的那个。
- 一次只改一样东西(光照,或姿势,或配色)再重新生成,或者使用工具的编辑/变体/局部重绘功能。每次都重写整段提示词会丢掉原本有效的部分。
- 确认许可覆盖你的用途(商业用途?),并保留/附上来源信息(Content Credentials),使成品可追溯。在需要的场合披露它是 AI 生成的。
图像生成提示词示例(媒介 → 主体 → 风格 → 细节)
A cinematic wide-angle photograph of a lighthouse on a rocky cliff at golden hour, waves crashing below, dramatic storm clouds parting. Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field. Mood: hopeful, epic. Aspect ratio 16:9. Tip: if the result is close, change ONE element next pass (e.g. "blue hour" instead of "golden hour") and re-roll — or add a reference image to lock the look.
权利、来源与伦理——不可协商的底线
媒体 AI 引出了文本对话通常不会碰到的问题。请把这些当作工作的一部分,而不是事后补救。
使用权与商业权利。 每个工具都有自己的许可,而且差异很大。有些限制商业用途,有些只在付费档位授予,而且输出可能类似受版权或商标保护的作品。以 Adobe Firefly 为例,它依赖的是出于商业安全考虑而挑选的训练数据——但你仍然应该去读你所用工具和档位的实际许可条款,而不是想当然。
来源与水印。 一项日益普及的标准,C2PA / Content Credentials,会附加防篡改的"营养标签"式元数据,记录一件成品是如何制作和编辑的。如今许多主流图像和视频工具都嵌入了它。请保持来源信息完整,并优先选择支持它的工具——它正在成为可信媒体的常态。
深度伪造、声音与知情同意。 逼真的人脸和语音生成可以冒充真实的人。未经明确同意,不要克隆某人的声音或肖像;绝不要用生成的媒体去欺骗;并遵守你所在司法辖区的法律。语音克隆的同意和 AI 生成内容的披露不只是礼仪——它们越来越多地成为法律要求。
- 生成的媒体可能带有使用权限制和深度伪造/知情同意风险——请检查每个工具的许可,并披露 AI 生成的内容。
从你的文本 AI 技能里能迁移什么
好消息:你已经掌握的很多东西都能迁移过来。
- 清晰、具体的提示词 —— 在任何模态下,具体说明你想要什么都胜过含糊的愿望。
- 迭代胜过一次成型 —— 你和 Claude 一起用的那套"起草、批评、精修"循环同样适用,只是把追问消息换成了重新生成和参考图像。见 提示词基础。
- 为任务选对工具 —— 选择模型 那套框架(先看约束条件,再做一个微小的真实世界测试)用在媒体上同样奏效。
- 理解模型究竟是什么 —— 明白这些是模式学习者、而非魔法,能让你的预期和伦理都保持端正。见 基础。
自我检测
自我检测
0/4记忆卡片
- 生成式媒体是与文本对话不同的 AI 分支:它生成图像、视频、语音和音乐,而你要靠参考输入和重新生成来引导它,而不只是文字。
- 用原型来思考——图像、视频、语音/音乐、语音转文本——并记住闭源对开放权重的那个分叉(例如 Midjourney 对 Stable Diffusion/FLUX;托管 TTS 对开放的 Whisper)。
- 可迁移的技能从文本 AI 沿用过来:具体的提示词、迭代,以及为任务选对工具。
- 权利和伦理是工作的一部分:检查你所用工具和档位的许可,保留来源信息(C2PA/Content Credentials),为声音/肖像获取同意,并披露 AI 生成的媒体。
- 具体细节很快就会过时——在依赖之前,对照各工具自己的页面核实版本、价格和能力。
来源与延伸阅读
- Midjourney — https://www.midjourney.com/
- OpenAI 图像生成(DALL·E 3)— https://openai.com/index/dall-e-3/
- OpenAI 图像生成 API 指南 — https://platform.openai.com/docs/guides/image-generation
- Google — Gemini 图像生成("Nano Banana")— https://gemini.google/overview/image-generation/
- Google DeepMind — Veo(视频)— https://deepmind.google/models/veo/
- Adobe Firefly — https://firefly.adobe.com/
- Black Forest Labs — FLUX — https://bfl.ai/
- OpenAI Sora — https://openai.com/index/sora/
- Runway — https://runwayml.com/
- Kling(快手)— https://kling.ai/
- Pika — https://pika.art/
- ElevenLabs — https://elevenlabs.io/
- Suno — https://suno.com/
- Udio — https://www.udio.com/
- OpenAI Whisper(开源语音转文本)— https://github.com/openai/whisper
- C2PA — Coalition for Content Provenance and Authenticity — https://c2pa.org/
- Content Credentials — https://contentcredentials.org/
- Artificial Analysis(独立的模型/价格跟踪站点)— https://artificialanalysis.ai/