الوسائط التوليدية: الذكاء الاصطناعي للصورة والصوت والفيديو
معظم AILmanac يدور حول ذكاء اصطناعي يكتب ويستدلّ — نماذج نصية مثل Claude. لكن فرعًا آخر كاملًا من الذكاء الاصطناعي يصنع الوسائط: صورًا وفيديو وأصواتًا وموسيقى انطلاقًا من موجّه. هذه الصفحة خريطة محايدة تجاه المزوّد لهذا المشهد: الأنماط الأساسية، والأدوات البارزة (كلٌّ منها مُتحقَّق من وجوده)، وكيف تختلف عن نماذج النصّ الكبيرة، والمهارات التي تنتقل معك، وقواعد الحقوق والأخلاقيات التي لا يمكنك تخطّيها.
- اعرف الأنماط الأساسية للوسائط التوليدية — الصورة، الفيديو، الصوت/الموسيقى، تحويل الكلام إلى نصّ — وأداة حقيقية في كلٍّ منها
- افهم كيف تختلف نماذج الوسائط عن نموذج دردشة نصّية مثل Claude
- تعلّم المهارات الدائمة: صياغة الأوامر للوسائط، والتكرار، ومدخلات المرجع
- احترم ما لا تنازل فيه: حقوق الاستخدام، والمصدرية/العلامة المائية، وأخلاقيات التزييف العميق/الموافقة
كيف تختلف نماذج الوسائط عن نموذج نصّي كبير
إن كنت قد استخدمت نموذج دردشة فقط، فأربعة فروق تهمّ:
- مخرجات مختلفة، و"صواب" مختلف. يُرجع النموذج النصّي إجابةً واحدة أفضل، حتمية في معظمها. أما نموذج الوسائط فيُرجع قِطعة فنّية (صورة، مقطعًا، أداءً صوتيًّا) لا يوجد فيها جواب واحد صحيح — بل جوابات تفضّلها أكثر أو أقل. تولّد عدّة وتختار.
- عادةً لا يمكنك تحرير المخرجات بتحرير الموجّه وحده. تعديل كلمة واحدة قد يغيّر الصورة بأكملها. التحكّم الحقيقي يأتي من مدخلات المرجع (صورة بدء، صورة نمط، صوت مرجعي) زائد ضوابط خاصّة بالأداة، لا من الكلمات فقط.
- البذور والتنويع جزء من سير العمل. كثير من الأدوات تتيح لك إعادة الرمي، أو التنويع، أو تثبيت "بذرة" (seed) لقابلية التكرار. التكرار هو القاعدة، لا الفشل.
- وحدة التكلفة مختلفة. يُحاسِب النصّ بالرموز (tokens)؛ أما الوسائط فتُحاسِب بـ الصورة، أو ثانية الفيديو، أو الحرف/دقيقة الصوت — والفيديو خاصّةً قد يصبح مكلفًا بسرعة.
- نموذج ذهني: النموذج النصّي كاتبٌ يعطيك الجواب؛ نموذج الوسائط ماكينة قِمار بمقود — تسحب، ثم توجّه بالمراجع وإعادة الرمي حتى يستقيم.
- ولّد دفعة وانتقِ. ذوقك — معرفة أيّ من المخرجات الأربعة أفضل — هو نصف المهارة.
الخريطة: الأنماط الأساسية والأدوات البارزة
فكّر بـ الأنماط الأساسية — التشكيلات تتبدّل باستمرار، والفئات ثابتة. كل أداة مذكورة أدناه مُتحقَّق من وجودها برابط حقيقي (في المصادر)؛ الإصدارات المحدّدة تُركت غامضة عمدًا لأنها تتبدّل بسرعة.
توليد الصور (من نصّ إلى صورة)
حوّل موجّهًا نصّيًّا — واختياريًّا صور مرجع — إلى صورة ساكنة.
- Midjourney — مغلق، مُستضاف؛ معروف بجماليّة افتراضية قوية وضوابط للنمط/المرجع.
- OpenAI image generation (خطّ DALL·E / GPT Image) — مغلق، مُستضاف؛ مدمج بإحكام في ChatGPT والـ API.
- Google's Gemini image generation ("Nano Banana") وImagen — مغلق، مُستضاف؛ موصولان بـ Gemini وGoogle Cloud.
- Adobe Firefly — مغلق، مُستضاف؛ مبنيّ لسير العمل الإبداعي ومُدرَّب مع مراعاة الاستخدام التجاري (انظر الحقوق أدناه).
- Stable Diffusion (Stability AI) وFLUX (Black Forest Labs) — عائلتا نماذج مفتوحة الأوزان يمكنك تنزيلها وتشغيلها بنفسك، وهما العمود الفقري لمنظومة الصور المحلية/المفتوحة.
توليد الفيديو (من نصّ/صورة إلى فيديو)
ولّد مقاطع قصيرة — متزايدة بصوت متزامن — من موجّه أو صورة بدء.
- OpenAI Sora — نموذج فيديو متقدّم (ملاحظة: أُوقِف التطبيق الاستهلاكي المستقلّ؛ واستمرّ النموذج عبر الـ API — مثال نموذجي على سبب تقادم الإصدارات/التوفّر).
- Google Veo — فيديو متقدّم، بصوت أصيل في الإصدارات الحديثة.
- Runway — مجموعة إبداعية مبنية حول نماذج الفيديو من سلسلة Gen.
- Kling (من Kuaishou) وPika — أدوات فيديو سريعة التطوّر، رائجة للمحتوى الاجتماعي/القصير.
الصوت والكلام والموسيقى (الصوتيات)
- ElevenLabs — مغلق، مُستضاف؛ تحويل نصّ إلى كلام واقعي وأدوات صوتية (لاستنساخ الصوت تبعات موافقة حقيقية — انظر الأخلاقيات).
- Suno وUdio — يولّدان أغاني كاملة (غناء + عزف) من موجّه نصّي.
- OpenAI Whisper — الاتجاه الآخر: تحويل الكلام إلى نصّ (النسخ). وهو مفتوح الأوزان (برخصة MIT)، فيمكنك تشغيله بنفسك أو استدعاء API مُستضاف. تحويل الكلام إلى نصّ هو حصان العمل الهادئ خلف التسميات التوضيحية، والملاحظات الصوتية، ومحاضر الاجتماعات.
- أكبر مفترق منفرد (كما في النماذج النصّية): أدوات مُستضافة مغلقة CLOSED (غالبًا أفضل جودة وأقلّ إعداد) مقابل نماذج مفتوحة الأوزان OPEN-WEIGHT مثل Stable Diffusion وFLUX وWhisper التي يمكنك استضافتها ذاتيًّا للخصوصية والتحكّم وتكلفة أقلّ عند التوسّع.
- لا تختر بحسب لوحة المتصدّرين. لمظهرك/صوتك الفعلي، ولّد بضعة أمثلة حقيقية في 2-3 أدوات واحكم بعينيك وأذنيك.
كيف تحصل على نتيجة جيّدة من نموذج وسائط
سير العمل أشبه بجلسة تصوير منه بحثٍ على Google. هذه الخطوات محايدة تجاه الأداة:
- ابدأ بالموضوع الرئيسي، ثم أضِف المكان والفعل والمزاج. 'ثعلب أحمر' ضعيف؛ أما 'ثعلب أحمر ملتفّ نائم في ثلج طازج، ضوء صباحي ناعم' فيمنح النموذج ما يشتغل عليه.
- قل أيّ نوع من الصورة/الفيديو/الصوت هو: صورة فوتوغرافية أم رسم توضيحي أم تصيير ثلاثي الأبعاد؛ الكاميرا/العدسة أو الأسلوب الفنّي؛ للصوت، النوع والإيقاع والنبرة العاطفية. في النمط يكمن معظم المظهر.
- صورة بدء، أو صورة مرجع نمط، أو مقطع صوتي مرجعي يتحكّم في النتيجة بموثوقية أكبر بكثير من الصفات. هذه هي المهارة الدائمة التي يفوّتها من يصوغ الأوامر نصًّا فقط.
- أنتِج عدّة تنويعات. اختر الأقرب — ذوقك جزء من الأداة. لا تتوقّع أن يكون الرمي الأول هو الأمثل.
- غيّر شيئًا واحدًا في كل مرة (الإضاءة، أو الوضعية، أو لوحة الألوان) وأعِد الرمي، أو استخدم ميزات التحرير/التنويع/الطلاء الداخلي في الأداة. إعادة كتابة الموجّه كاملًا في كل مرة تفقد ما كان ناجحًا.
- تأكّد أن الرخصة تغطّي استخدامك (تجاري؟)، واحتفظ بالمصدرية وأرفِقها (Content Credentials) كي يكون الأصل قابلًا للتتبّع. أفصِح عن أنه مولَّد بالذكاء الاصطناعي حيث يهمّ ذلك.
مثال على موجّه توليد صورة (الوسيط ← الموضوع ← النمط ← التفاصيل)
A cinematic wide-angle photograph of a lighthouse on a rocky cliff at golden hour, waves crashing below, dramatic storm clouds parting. Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field. Mood: hopeful, epic. Aspect ratio 16:9. Tip: if the result is close, change ONE element next pass (e.g. "blue hour" instead of "golden hour") and re-roll — or add a reference image to lock the look.
الحقوق والمصدرية والأخلاقيات — ما لا تنازل فيه
يثير الذكاء الاصطناعي للوسائط قضايا لا تثيرها الدردشة النصّية عادةً. عامِلها كجزء من العمل، لا كأمرٍ لاحق.
حقوق الاستخدام والحقوق التجارية. لكل أداة رخصتها الخاصّة، وهي تختلف كثيرًا. بعضها يقيّد الاستخدام التجاري، وبعضها يمنحه على المستويات المدفوعة فقط، وقد تشبه المخرجات أعمالًا محميّة بحقوق النشر أو العلامات التجارية. Adobe Firefly مثلًا يعتمد على بيانات تدريب مُختارة مع مراعاة السلامة التجارية — لكن ينبغي لك رغم ذلك أن تقرأ الرخصة الفعلية للأداة والمستوى الذي أنت عليه بدل الافتراض.
المصدرية والعلامة المائية. ثمّة معيار متنامٍ، C2PA / Content Credentials، يُرفِق بيانات وصفية بأسلوب "ملصق تغذية" مقاوِمة للعبث تسجّل كيف صُنع الأصل وحُرِّر. كثير من أدوات الصور والفيديو الكبرى تضمّنه الآن. أبقِ تلك المصدرية سليمة، وفضّل الأدوات التي تدعمها — فهي تصبح المعيار للوسائط الجديرة بالثقة.
التزييف العميق والأصوات والموافقة. يمكن لتوليد الوجوه والأصوات الواقعي أن ينتحل أشخاصًا حقيقيين. لا تستنسخ صوتًا أو مظهرًا دون موافقة صريحة، ولا تستخدم أبدًا وسائط مولَّدة للخداع، والتزم بالقانون في نطاق ولايتك. موافقة استنساخ الصوت والإفصاح عن المحتوى المولَّد بالذكاء الاصطناعي ليسا مجرّد آداب — بل صارا بشكل متزايد متطلّبات قانونية.
- قد تحمل الوسائط المولَّدة قيودًا على حقوق الاستخدام ومخاطر التزييف العميق/الموافقة — تحقّق من رخصة كل أداة وأفصِح عن المحتوى المولَّد بالذكاء الاصطناعي.
ما الذي ينتقل من مهاراتك في الذكاء الاصطناعي النصّي
خبر سار: كثير مما تعرفه بالفعل ينتقل معك.
- صياغة أوامر واضحة ومحدّدة — التحديد فيما تريده يتفوّق على الأمنيات الغامضة، في كل نمط.
- التكرار بدل الضربة الواحدة — حلقة "مسودّة، نقد، تحسين" ذاتها التي تستخدمها مع Claude تنطبق، فقط بإعادة الرمي وصور المرجع بدل رسائل المتابعة. انظر أساسيات صياغة الأوامر.
- اختيار الأداة الصحيحة للمهمة — الإطار من اختيار نموذج (القيود أولًا، ثم اختبار واقعي صغير) يعمل تمامًا مع الوسائط.
- فهم ما هو النموذج فعلًا — معرفة أن هذه متعلِّمات أنماط، لا سحر، تُبقي توقّعاتك وأخلاقياتك مستقيمة. انظر الأسس.
اختبر نفسك
اختبر نفسك
0/4البطاقات التعليمية
- الوسائط التوليدية فرع منفصل من الذكاء الاصطناعي عن الدردشة النصّية: يصنع صورًا وفيديو وصوتًا وموسيقى، وتوجّهه بالمراجع وإعادة الرمي، لا بالكلمات فقط.
- فكّر بالأنماط الأساسية — صورة، فيديو، صوت/موسيقى، تحويل الكلام إلى نصّ — وتذكّر مفترق المغلق مقابل مفتوح الأوزان (مثل Midjourney مقابل Stable Diffusion/FLUX؛ تحويل النصّ إلى كلام مُستضاف مقابل Whisper المفتوح).
- المهارات الدائمة تنتقل من الذكاء الاصطناعي النصّي: صياغة أوامر محدّدة، والتكرار، واختيار الأداة الصحيحة للمهمة.
- الحقوق والأخلاقيات جزء من العمل: تحقّق من رخصة أداتك ومستواك، وأبقِ المصدرية (C2PA/Content Credentials)، واحصل على موافقة للأصوات/المظاهر، وأفصِح عن الوسائط المولَّدة بالذكاء الاصطناعي.
- التفاصيل تتقادم بسرعة — تحقّق من الإصدارات والأسعار والقدرات مقابل صفحة كل أداة نفسها قبل الاعتماد عليها.
المصادر وقراءات إضافية
- Midjourney — https://www.midjourney.com/
- توليد صور OpenAI (DALL·E 3) — https://openai.com/index/dall-e-3/
- دليل API توليد صور OpenAI — https://platform.openai.com/docs/guides/image-generation
- Google — توليد صور Gemini ("Nano Banana") — https://gemini.google/overview/image-generation/
- Google DeepMind — Veo (فيديو) — https://deepmind.google/models/veo/
- Adobe Firefly — https://firefly.adobe.com/
- Black Forest Labs — FLUX — https://bfl.ai/
- OpenAI Sora — https://openai.com/index/sora/
- Runway — https://runwayml.com/
- Kling (Kuaishou) — https://kling.ai/
- Pika — https://pika.art/
- ElevenLabs — https://elevenlabs.io/
- Suno — https://suno.com/
- Udio — https://www.udio.com/
- OpenAI Whisper (تحويل الكلام إلى نصّ مفتوح المصدر) — https://github.com/openai/whisper
- C2PA — تحالف مصدرية المحتوى وأصالته — https://c2pa.org/
- Content Credentials — https://contentcredentials.org/
- Artificial Analysis (مُتتبِّع مستقلّ للنماذج/الأسعار) — https://artificialanalysis.ai/