生成メディア: 画像・音声・動画AI
AILmanacの大半は、書き、推論するAI — Claudeのようなテキストモデル — についてのものです。しかしAIにはまったく別の枝もあります。それはプロンプトからメディアを作るもの、つまり画像、動画、音声、音楽です。このページは、そのランドスケープのプロバイダー中立な地図です。アーキタイプ、注目すべきツール(それぞれ実在を検証済み)、テキストLLMとの違い、引き継げるスキル、そして飛ばすことのできない権利と倫理のルールを扱います。
- 生成メディアの主要なアーキタイプ — 画像、動画、音声/音楽、音声認識 — と、それぞれの実在するツールを知る
- メディアモデルが、Claudeのようなテキストチャットモデルとどう違うかを理解する
- 長く使えるスキルを学ぶ: メディア向けのプロンプティング、反復、参照入力
- 譲れない原則を尊重する: 利用権、来歴/ウォーターマーク、ディープフェイク/同意の倫理
メディアモデルがテキストLLMとどう違うか
チャットモデルしか使ったことがないなら、4つの違いが重要です:
- 出力が違えば、「正解」も違う。 テキストモデルは、ほぼ決定論的な最良の答えを1つ返します。メディアモデルは成果物(画像、クリップ、音声テイク)を返しますが、そこに唯一の正解はありません — あるのは、より好きか、より好きでないかだけです。複数生成して、選ぶのです。
- たいてい、プロンプトをいじるだけでは出力を編集できない。 1単語を変えると、画像全体が変わることがあります。本当のコントロールは、言葉だけでなく、参照入力(開始画像、スタイル画像、参照音声)とツール固有のコントロールから得られます。
- シードとバリエーションがワークフローの一部。 多くのツールでは、再ロール、バリエーション生成、あるいは再現性のために「シード」を固定することができます。反復は失敗ではなく、当たり前です。
- コストの単位が違う。 テキストはトークンで課金されますが、メディアは1画像、動画1秒、音声の1文字/1分で課金されます — 特に動画はすぐに高額になりがちです。
- メンタルモデル: テキストモデルは答えをくれる書き手、メディアモデルはハンドル付きのスロットマシン — レバーを引き、それから参照入力と再ロールで、正しくなるまで舵を取る。
- バッチで生成して、選り抜く。あなたのセンス — 4つの出力のうちどれが最良かを知ること — がスキルの半分です。
地図: アーキタイプと注目すべきツール
アーキタイプで考えましょう — 顔ぶれは絶えず入れ替わりますが、カテゴリは安定しています。以下に挙げるすべてのツールは、実在するURL(Sources内)とともに実在が検証されています。具体的なバージョンは、めまぐるしく入れ替わるため、意図的にあいまいにしてあります。
画像生成(テキストから画像へ)
テキストプロンプト — そしてオプションで参照画像 — を、1枚の静止画に変えます。
- Midjourney — クローズド、ホスト型。強力なデフォルトの美的感覚と、スタイル/参照のコントロールで知られています。
- OpenAIの画像生成(DALL·E / GPT Imageの系列) — クローズド、ホスト型。ChatGPTとAPIに緊密に統合されています。
- GoogleのGeminiの画像生成(「Nano Banana」)とImagen — クローズド、ホスト型。GeminiとGoogle Cloudに組み込まれています。
- Adobe Firefly — クローズド、ホスト型。クリエイティブなワークフロー向けに作られ、商用利用を念頭に学習されています(以下の権利の項を参照)。
- Stable Diffusion(Stability AI)とFLUX(Black Forest Labs) — 自分でダウンロードして実行できるオープンウェイトのモデルファミリーで、ローカル/オープンな画像エコシステムの屋台骨です。
動画生成(テキスト/画像から動画へ)
プロンプトや開始画像から、短いクリップ — ますます同期音声付きで — を生成します。
- OpenAI Sora — フロンティアの動画モデル(注: 単独の消費者向けアプリは提供終了しましたが、モデルはAPIを通じて継続されました — バージョンや提供状況が古くなる理由の典型例です)。
- Google Veo — フロンティアの動画で、最近のバージョンではネイティブ音声付き。
- Runway — Gen系列の動画モデルを中心に作られたクリエイティブスイート。
- Kling(Kuaishou製)とPika — ソーシャル/短尺コンテンツで人気の、進化の速い動画ツール。
音声、スピーチ、音楽(オーディオ)
- ElevenLabs — クローズド、ホスト型。リアルなテキスト読み上げと音声ツール(ボイスクローニングには現実的な同意上の含意があります — 倫理の項を参照)。
- SunoとUdio — テキストプロンプトから、完成した楽曲(ボーカル + 楽器演奏)を生成します。
- OpenAI Whisper — 逆方向: 音声認識(文字起こし)。オープンウェイト(MITライセンス)なので、自分で実行することも、ホスト型APIを呼ぶこともできます。音声認識は、字幕、ボイスメモ、会議の文字起こしを支える、目立たない働き者です。
- 最大の分岐点(テキストモデルと同じ): クローズドのホスト型ツール(多くの場合、最高品質、最小のセットアップ) vs Stable Diffusion、FLUX、Whisperのようなオープンウェイトモデル(プライバシー、コントロール、そして大規模時の低コストのために自己ホストできる)。
- リーダーボードで選ばないこと。あなたが実際に求める見た目/音のために、2~3のツールで実例をいくつか生成し、自分の目と耳で判断しましょう。
メディアモデルから良い結果を得る方法
ワークフローは、Google検索というより写真撮影に近いものです。これらのステップはツールに依存しません:
- まず主要な被写体から始め、それから設定、動作、雰囲気を加えます。「赤いキツネ」は弱い。「新雪の中で丸まって眠る赤いキツネ、柔らかな朝の光」なら、モデルに取り組む素材を与えます。
- それがどんな種類の画像/動画/音声かを言います: 写真かイラストか3Dレンダーか、カメラ/レンズか画風か、音声ならジャンル、テンポ、感情のトーン。見た目の大半はスタイルに宿ります。
- 開始画像、スタイル参照画像、参照音声クリップは、形容詞よりもはるかに確実に結果をコントロールします。これは、テキストだけのプロンプターが見落とす、長く使えるスキルです。
- いくつかのバリエーションを作ります。一番近いものを選びましょう — あなたのセンスがツールの一部です。最初の一発が当たりだと期待してはいけません。
- 一度に1つだけ(照明、またはポーズ、または配色)を変えて再ロールするか、ツールの編集/バリエーション/インペイント機能を使います。毎回プロンプト全体を書き直すと、うまくいっていた部分を失います。
- ライセンスがあなたの用途(商用?)をカバーしているか確認し、来歴(Content Credentials)を保持/添付して、アセットが追跡可能であるようにします。重要な場面では、AI生成であることを開示しましょう。
画像生成プロンプトの例(媒体 → 被写体 → スタイル → ディテール)
A cinematic wide-angle photograph of a lighthouse on a rocky cliff at golden hour, waves crashing below, dramatic storm clouds parting. Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field. Mood: hopeful, epic. Aspect ratio 16:9. Tip: if the result is close, change ONE element next pass (e.g. "blue hour" instead of "golden hour") and re-roll — or add a reference image to lock the look.
権利、来歴、倫理 — 譲れない原則
メディアAIは、テキストチャットでは普段生じない問題を引き起こします。これらを後回しではなく、仕事の一部として扱いましょう。
利用権と商用権。 どのツールにも独自のライセンスがあり、それらは大きく異なります。商用利用を制限するものもあれば、有料プランでのみそれを許可するものもあり、出力が著作権や商標で保護された作品に似てしまうこともあります。例えばAdobe Fireflyは、商用上の安全性を念頭に選ばれた学習データに依拠していますが — それでも、思い込みではなく、あなたが使っているツールとプランの実際のライセンスを読むべきです。
来歴とウォーターマーク。 成長しつつある標準であるC2PA / Content Credentialsは、アセットがどのように作られ編集されたかを記録する、改ざんが検知できる「栄養成分表示」のようなメタデータを添付します。多くの主要な画像・動画ツールが、いまやこれを埋め込んでいます。その来歴を保持し、それをサポートするツールを選びましょう — 信頼できるメディアの当たり前になりつつあります。
ディープフェイク、声、同意。 リアルな顔・声の生成は、実在の人物になりすますことができます。明示的な同意なしに声や容姿をクローンしないこと、生成メディアを欺くために決して使わないこと、そしてあなたの法域の法律に従うこと。ボイスクローニングの同意とAI生成コンテンツの開示は、単なるエチケットではありません — ますます法的要件になりつつあります。
- 生成メディアは利用権の制限やディープフェイク/同意のリスクを伴うことがある — 各ツールのライセンスを確認し、AI生成コンテンツであることを開示すること。
あなたのテキストAIスキルから引き継げるもの
良い知らせ: あなたがすでに知っていることの多くが、引き継がれます。
- 明確で具体的なプロンプティング — 求めるものについて具体的であることは、あらゆるモダリティで、曖昧な願いに勝ります。
- 一発勝負ではなく反復 — Claudeで使うのと同じ「下書き、批評、推敲」のループが、フォローアップのメッセージの代わりに再ロールと参照画像を使う形で適用されます。プロンプティングの基礎を参照。
- タスクに合った正しいツールを選ぶ — モデルの選び方のフレームワーク(まず制約、それから小さな実世界テスト)は、メディアでも同じくらいうまく機能します。
- モデルが実際に何であるかを理解する — これらが魔法ではなくパターン学習器であると知ることは、あなたの期待と倫理をまっすぐに保ちます。基礎を参照。
理解度チェック
理解度チェック
0/4フラッシュカード
- 生成メディアは、テキストチャットとは別のAIの枝です: 画像、動画、音声、音楽を作り、言葉だけでなく参照入力と再ロールで舵を取ります。
- アーキタイプで考えること — 画像、動画、音声/音楽、音声認識 — そしてクローズドかオープンウェイトかの分岐を忘れないこと(例: Midjourney vs Stable Diffusion/FLUX、ホスト型TTS vs オープンなWhisper)。
- 長く使えるスキルはテキストAIから引き継がれます: 具体的なプロンプティング、反復、そしてタスクに合った正しいツールの選択。
- 権利と倫理は仕事の一部です: あなたのツールとプランのライセンスを確認し、来歴(C2PA/Content Credentials)を保持し、声/容姿の同意を得て、AI生成メディアであることを開示しましょう。
- 具体的な情報はすぐに腐ります — 頼る前に、各ツール自身のページに照らしてバージョン、価格、機能を検証しましょう。
出典とさらに読む
- Midjourney — https://www.midjourney.com/
- OpenAIの画像生成(DALL·E 3) — https://openai.com/index/dall-e-3/
- OpenAIの画像生成APIガイド — https://platform.openai.com/docs/guides/image-generation
- Google — Geminiの画像生成(「Nano Banana」) — https://gemini.google/overview/image-generation/
- Google DeepMind — Veo(動画) — https://deepmind.google/models/veo/
- Adobe Firefly — https://firefly.adobe.com/
- Black Forest Labs — FLUX — https://bfl.ai/
- OpenAI Sora — https://openai.com/index/sora/
- Runway — https://runwayml.com/
- Kling(Kuaishou) — https://kling.ai/
- Pika — https://pika.art/
- ElevenLabs — https://elevenlabs.io/
- Suno — https://suno.com/
- Udio — https://www.udio.com/
- OpenAI Whisper(オープンソースの音声認識) — https://github.com/openai/whisper
- C2PA — Coalition for Content Provenance and Authenticity — https://c2pa.org/
- Content Credentials — https://contentcredentials.org/
- Artificial Analysis(独立したモデル/価格トラッカー) — https://artificialanalysis.ai/