본문으로 건너뛰기

생성형 미디어: 이미지, 오디오 및 비디오 AI

초급

AILmanac 대부분은 글을 쓰고 추론하는 AI — Claude 같은 텍스트 모델에 관한 것입니다. 하지만 AI의 또 다른 큰 갈래는 프롬프트로부터 미디어를 만듭니다: 그림, 비디오, 음성, 음악. 이 페이지는 그 지형에 대한 공급자 중립적인 지도입니다: 원형(archetype), 주목할 만한 도구(각각 실존이 확인됨), 텍스트 LLM과의 차이점, 이전되는 기술, 그리고 건너뛸 수 없는 권리·윤리 규칙.

What you'll learn
  • 생성형 미디어의 주요 원형 — 이미지, 비디오, 음성/음악, 음성-텍스트 변환 — 과 각각의 실제 도구를 알기
  • 미디어 모델이 Claude 같은 텍스트 채팅 모델과 어떻게 다른지 이해하기
  • 지속되는 기술 배우기: 미디어를 위한 프롬프팅, 반복(iteration), 참조 입력
  • 타협 불가능한 것들 존중하기: 사용 권리, 출처/워터마킹, 딥페이크/동의 윤리

미디어 모델이 텍스트 LLM과 어떻게 다른가

채팅 모델만 사용해 봤다면, 네 가지 차이가 중요합니다:

  • 다른 출력, 다른 "정답". 텍스트 모델은 대부분 결정론적인 하나의 최선의 답을 반환합니다. 미디어 모델은 결과물(이미지, 클립, 음성 테이크)을 반환하는데, 여기에는 하나의 정답이 없습니다 — 그저 더 마음에 드는 것과 덜 드는 것이 있을 뿐입니다. 여러 개를 생성하고 골라냅니다.
  • 보통 프롬프트만 수정해서 출력을 편집할 수는 없습니다. 단어 하나를 바꾸면 이미지 전체가 바뀔 수 있습니다. 진짜 통제력은 단어가 아니라 참조 입력(시작 이미지, 스타일 이미지, 참조 음성)과 도구별 컨트롤에서 나옵니다.
  • 시드(seed)와 변형은 워크플로의 일부입니다. 많은 도구가 재추첨(re-roll), 변형, 또는 재현성을 위해 "시드"를 고정하는 기능을 제공합니다. 반복은 실패가 아니라 표준입니다.
  • 비용 단위가 다릅니다. 텍스트는 토큰으로 청구합니다; 미디어는 이미지, 비디오의 초, 또는 오디오의 글자/분으로 청구합니다 — 그리고 특히 비디오는 빠르게 비싸질 수 있습니다.
Pro tip
  • 심상 모델(mental model): 텍스트 모델은 답을 주는 작가이고; 미디어 모델은 핸들이 달린 슬롯머신입니다 — 당겨서, 참조와 재추첨으로 제대로 될 때까지 조종합니다.
  • 한 배치(batch)를 생성하고 큐레이션하세요. 4개의 출력 중 어느 것이 최고인지 아는 당신의 안목 — 그것이 기술의 절반입니다.

지도: 원형과 주목할 만한 도구

원형으로 생각하세요 — 라인업은 끊임없이 뒤섞이지만, 카테고리는 안정적입니다. 아래 이름이 언급된 모든 도구는 실제 URL(Sources에 있음)로 실존이 확인되었습니다; 특정 버전은 자주 바뀌기 때문에 의도적으로 모호하게 남겨두었습니다.

이미지 생성 (텍스트-투-이미지)

텍스트 프롬프트 — 그리고 선택적으로 참조 이미지 — 를 정지 그림으로 바꿉니다.

  • Midjourney — 폐쇄형, 호스팅; 강력한 기본 미학과 스타일/참조 컨트롤로 알려짐.
  • OpenAI 이미지 생성 (DALL·E / GPT Image 계열) — 폐쇄형, 호스팅; ChatGPT와 API에 긴밀히 통합됨.
  • Google의 Gemini 이미지 생성 ("Nano Banana")과 Imagen — 폐쇄형, 호스팅; Gemini와 Google Cloud에 연결됨.
  • Adobe Firefly — 폐쇄형, 호스팅; 크리에이티브 워크플로를 위해 만들어졌고 상업적 사용을 염두에 두고 학습됨(아래 권리 참조).
  • Stable Diffusion (Stability AI)과 FLUX (Black Forest Labs) — 직접 다운로드하여 실행할 수 있는 오픈-웨이트 모델 계열로, 로컬/오픈 이미지 생태계의 근간.

비디오 생성 (텍스트/이미지-투-비디오)

프롬프트나 시작 이미지로부터 짧은 클립 — 점점 더 동기화된 오디오와 함께 — 을 생성합니다.

  • OpenAI Sora — 프런티어 비디오 모델(참고: 독립형 소비자용 앱은 중단되었고; 모델은 API를 통해 계속됨 — 버전/가용성이 왜 낡게 되는지를 보여주는 교과서적 예).
  • Google Veo — 프런티어 비디오, 최근 버전에서는 네이티브 오디오 지원.
  • Runway — Gen 시리즈 비디오 모델을 중심으로 구축된 크리에이티브 스위트.
  • Kling (Kuaishou 제작)과 Pika — 소셜/숏폼 콘텐츠로 인기 있는 빠르게 발전하는 비디오 도구.

음성, 스피치 및 음악 (오디오)

  • ElevenLabs — 폐쇄형, 호스팅; 실감나는 텍스트-투-스피치와 음성 도구(음성 복제는 실제 동의 관련 문제가 있음 — 윤리 참조).
  • SunoUdio — 텍스트 프롬프트로부터 완전한 노래(보컬 + 반주)를 생성.
  • OpenAI Whisper — 반대 방향: 음성-텍스트 변환(전사). 오픈-웨이트(MIT 라이선스)이므로 직접 실행하거나 호스팅된 API를 호출할 수 있습니다. 음성-텍스트 변환은 자막, 음성 메모, 회의록 뒤에서 조용히 일하는 일꾼입니다.
Pro tip
  • 가장 큰 하나의 갈림길(텍스트 모델과 동일): 폐쇄형 호스팅 도구(흔히 최고 품질, 최소한의 설정) 대 Stable Diffusion, FLUX, Whisper 같은 오픈-웨이트 모델(프라이버시, 통제, 그리고 대규모에서의 낮은 비용을 위해 직접 셀프-호스팅 가능).
  • 리더보드로 고르지 마세요. 당신의 실제 룩/사운드를 위해서는, 2-3개 도구에서 몇 개의 실제 예시를 생성하고 당신 자신의 눈과 귀로 판단하세요.

미디어 모델에서 좋은 결과를 얻는 방법

워크플로는 구글 검색보다는 사진 촬영에 더 가깝습니다. 이 단계들은 도구에 구애받지 않습니다:

Guided walkthrough1 of 6
  1. 주요 피사체로 시작한 다음 배경, 동작, 분위기를 더하세요. '빨간 여우'는 약합니다; '갓 내린 눈 속에 웅크리고 잠든 빨간 여우, 부드러운 아침 빛'은 모델이 작업할 무언가를 줍니다.

이미지 생성 프롬프트 예시 (매체 → 피사체 → 스타일 → 세부사항)

A cinematic wide-angle photograph of a lighthouse on a rocky cliff
at golden hour, waves crashing below, dramatic storm clouds parting.
Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field.
Mood: hopeful, epic. Aspect ratio 16:9.

Tip: if the result is close, change ONE element next pass
(e.g. "blue hour" instead of "golden hour") and re-roll —
or add a reference image to lock the look.

권리, 출처 및 윤리 — 타협 불가능한 것들

미디어 AI는 텍스트 채팅에서 보통 제기되지 않는 문제들을 일으킵니다. 이것들을 나중에 처리할 일이 아니라 업무의 일부로 취급하세요.

사용 및 상업적 권리. 모든 도구에는 자체 라이선스가 있고, 서로 많이 다릅니다. 어떤 것은 상업적 사용을 제한하고, 어떤 것은 유료 등급에서만 허용하며, 출력물은 저작권이나 상표가 있는 작품을 닮을 수 있습니다. 예를 들어 Adobe Firefly는 상업적 안전을 염두에 두고 선택된 학습 데이터에 의존합니다 — 하지만 그래도 추정하지 말고 당신이 사용 중인 도구와 등급의 실제 라이선스를 읽어야 합니다.

출처 및 워터마킹. 점점 확산되는 표준인 C2PA / Content Credentials는 자산이 어떻게 만들어지고 편집되었는지 기록하는 변조 감지형 "영양 성분표" 메타데이터를 첨부합니다. 많은 주요 이미지 및 비디오 도구가 이제 이를 내장합니다. 그 출처 정보를 손상시키지 말고, 이를 지원하는 도구를 선호하세요 — 그것이 신뢰할 수 있는 미디어의 표준이 되어가고 있습니다.

딥페이크, 음성 및 동의. 사실적인 얼굴 및 음성 생성은 실제 사람을 사칭할 수 있습니다. 명시적 동의 없이 음성이나 외형을 복제하지 말고, 생성된 미디어를 속임수에 사용하지 말며, 당신의 관할권 법을 따르세요. 음성 복제 동의와 AI 생성 콘텐츠 공개는 단순한 에티켓이 아닙니다 — 점점 더 법적 요건이 되고 있습니다.

Watch out
  • 생성된 미디어는 사용-권리 제한과 딥페이크/동의 위험을 수반할 수 있습니다 — 각 도구의 라이선스를 확인하고 AI 생성 콘텐츠임을 공개하세요.

텍스트-AI 기술에서 무엇이 이전되는가

좋은 소식: 이미 알고 있는 것 중 많은 부분이 이전됩니다.

  • 명확하고 구체적인 프롬프팅 — 원하는 것을 구체적으로 말하는 것이 모호한 바람보다 낫습니다, 모든 양식(modality)에서.
  • 원샷보다 반복 — Claude에서 사용하던 것과 같은 "초안, 비평, 다듬기" 루프가 적용되는데, 다만 후속 메시지 대신 재추첨과 참조 이미지를 씁니다. 프롬프팅 기초를 참조하세요.
  • 작업에 맞는 도구 선택모델 선택하기의 프레임워크(제약을 먼저, 그다음 작은 실제 테스트)가 미디어에서도 마찬가지로 잘 작동합니다.
  • 모델이 실제로 무엇인지 이해하기 — 이것들이 마법이 아니라 패턴 학습기라는 걸 아는 것이 기대와 윤리를 바로잡아 줍니다. 기초를 참조하세요.

스스로 점검하기

스스로 점검하기

0/4
  1. 단어를 넘어서 — 미디어 모델 출력의 룩을 통제하는 가장 안정적인 방법은?
  2. 다음 중 직접 다운로드하여 실행할 수 있는 오픈-웨이트 도구는 무엇인가?
  3. C2PA / Content Credentials는 무엇인가?
  4. AI 생성 미디어를 상업적으로 사용하기 전에, 가장 안전한 조치는:

플래시카드

Enter 또는 스페이스 키를 눌러 카드를 뒤집습니다. 좌우 화살표 키로 카드를 이동할 수 있습니다.용어가 표시되었습니다.
1 / 6
Key takeaways
  • 생성형 미디어는 텍스트 채팅과 분리된 AI의 한 갈래입니다: 이미지, 비디오, 음성, 음악을 만들고, 단어만이 아니라 참조와 재추첨으로 조종합니다.
  • 원형으로 생각하세요 — 이미지, 비디오, 음성/음악, 음성-텍스트 변환 — 그리고 폐쇄형 대 오픈-웨이트의 갈림길을 기억하세요(예: Midjourney 대 Stable Diffusion/FLUX; 호스팅 TTS 대 오픈 Whisper).
  • 지속되는 기술은 텍스트 AI에서 이전됩니다: 구체적인 프롬프팅, 반복, 그리고 작업에 맞는 도구 선택.
  • 권리와 윤리는 업무의 일부입니다: 당신의 도구와 등급의 라이선스를 확인하고, 출처(C2PA/Content Credentials)를 유지하고, 음성/외형에 대한 동의를 얻고, AI 생성 미디어임을 공개하세요.
  • 구체적인 사항은 빠르게 부패합니다 — 의존하기 전에 각 도구의 자체 페이지에 대비해 버전, 가격, 기능을 검증하세요.

출처 및 더 읽을거리