יום שישי, 31 ביולי 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים יצירת תמונה ווידאו עם AI — מפת השטח 2026
מסלול לימוד

יצירת תמונה ווידאו עם AI — מפת השטח 2026

הכל על תמונה ווידאו generative: Midjourney, FLUX, Imagen, Sora, Veo, ComfyUI, Runway, Pika, ו-workflows מעשיים.

15 שעות
7 צמתים
מתחילים
01

Midjourney — הסטנדרט של איכות גבוהה

Midjourney v7 — איכות תמונות החדשה (סוף 2025). Discord vs web interface, prompt engineering ייחודי, פרמטרים: --ar, --s, --c, --weird, --sref. למה זה עדיין לרוב מנצח את המתחרים.

~3 שעותמתחילים
שיעור

Midjourney הוא אחד הכלים המובילים והפופולריים ביותר בעולם ליצירת תמונות באמצעות בינה מלאכותית (AI). עם יציאת גרסה Midjourney v7 בסוף שנת 2025, הכלי ביסס מחדש את מעמדו כסטנדרט הזהב של התעשייה בכל הקשור לאיכות ויזואלית, ריאליזם מדהים והבנת סגנונות אמנותיים מורכבים. בניגוד למתחרים כמו DALL-E 3 או Stable Diffusion, הוא מצטיין בטקסטורות עשירות, תאורה קולנועית ופרטים קטנים שעושים את ההבדל בין תמונה חובבנית ליצירת אמנות מקצועית.

מדוע Midjourney עדיין מנצח את המתחרים? התשובה טמונה במנוע הרינדור הייחודי שלו ובמאגר הנתונים שעליו הוא אומן. בעוד שכלים אחרים מתמקדים לעיתים בדיוק מילולי יבש של הפרומפט (Prompt), Midjourney נותן עדיפות לאסתטיקה ולחוויה הוויזואלית. הוא יודע "לפרש" את הכוונה האמנותית של המשתמש ולתרגם אותה לתוצאה פוטו-ריאליסטית או ציורית מרהיבה, גם ללא הגדרות טכניות מסובכות.

בעבר, הגישה היחידה ל-Midjourney הייתה דרך שרת ה-Discord שלו – חוויה שיכולה להיות מעט מאיימת למתחילים. כיום, לצד ממשק ה-Discord הוותיק והעוצמתי, Midjourney מציעה ממשק אינטרנט (Web Interface) מודרני, נקי ונוח המאפשר ליצור, לערוך ולנהל גלריות תמונות ישירות מהדפדפן. הממשק האינטרנטי הופך את תהליך היצירה לנגיש בהרבה, במיוחד עבור מעצבים ויוצרי תוכן שאינם מורגלים בעבודה עם בוטים בצ'אט.

הנדסת פרומפטים ב-Midjourney היא אמנות בפני עצמה, והיא נשענת רבות על שימוש בפרמטרים מובנים בסוף הפרומפט. הנה כמה מהפרמטרים החשובים ביותר שאתם חייבים להכיר:

  • --ar (Aspect Ratio): קביעת יחס הגובה-רוחב של התמונה (למשל --ar 16:9 למסך רחב).
  • --s (Stylize): קובע כמה ה-AI ישקיע באסתטיקה האמנותית (מ-0 עד 1000).
  • --c (Chaos): מידת הגיוון וההפתעה בתוצאות (מ-0 עד 100).
  • --weird (Weirdness): הוספת אלמנטים יוצאי דופן ואוונגרדיים לתמונה.
  • --sref (Style Reference): מאפשר להזין קישור לתמונה קיימת כדי להעתיק את הסגנון העיצובי שלה בצורה מדויקת.

הנה דוגמה לפרומפט מקצועי המשלב את הפרמטרים הללו:

/imagine prompt: A futuristic cybernetic oasis in the middle of a neon desert, cinematic lighting, photorealistic, hyper-detailed --ar 16:9 --s 750 --c 20 --weird 10 --v 7

לקריאה נוספת והעמקה, מומלץ לבקר ב-Midjourney Official Documentation המציג את כל העדכונים האחרונים של גרסה v7, וכן במדריך הקהילה Midjourney Prompt Guide on GitHub המכיל דוגמאות ויזואליות רבות לשימוש בפרמטרים השונים.

הצעד הבא שלכם: היכנסו לאתר הרשמי של Midjourney, התחברו באמצעות חשבון ה-Discord שלכם או ישירות לממשק ה-Web, ונסו להריץ את הפרומפט שמופיע למעלה. שחקו עם הפרמטרים – שנו את ערך ה---s ל-100 ולאחר מכן ל-900, וראו כיצד רמת האסתטיקה והפרטים של התמונה משתנה לחלוטין.

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
02

FLUX — Black Forest Labs ו-open source

FLUX.1 משפחת המודלים מ-Black Forest Labs (ע"י המייסדים של Stable Diffusion). pro/dev/schnell — מה ההבדל. שימוש דרך Replicate, fal.ai, מקומי דרך ComfyUI.

~4 שעותבינוני
שיעור

משפחת המודלים FLUX.1, שפותחה על ידי Black Forest Labs (הצוות המקורי שעמד מאחורי פיתוח Stable Diffusion), מסמנת עידן חדש בעולם יצירת התמונות בקוד פתוח (Open Source). המודלים מציגים קפיצת מדרגה דרמטית באיכות התמונה, דיוק בהבנת הנחיות טקסטואליות (Prompt Adherence), ויכולת חסרת תקדים לייצר טקסט קריא ומדויק בתוך התמונות עצמן – אתגר שבו מודלים קודמים התקשו מאוד.

כדי להתאים לצרכים שונים, המשפחה מחולקת לשלוש גרסאות עיקריות:

  1. FLUX.1 [pro]: הגרסה החזקה ביותר, הזמינה רק דרך ממשקי API מסחריים. היא מציעה את האיכות הגבוהה ביותר ומתאימה לשימוש תעשייתי.
  2. FLUX.1 [dev]: מודל בעל משקלים פתוחים (Open-weights) המיועד לשימוש לא מסחרי. הוא מציע איכות כמעט זהה לגרסת ה-pro ומתאים לפיתוח ומחקר.
  3. FLUX.1 [schnell]: הגרסה המהירה ביותר, המשוחררת תחת רישיון Apache 2.0 (חופשי לחלוטין, גם לשימוש מסחרי). המודל מותאם ליצירת תמונות ב-4 צעדים (Steps) בלבד, מה שהופך אותו לאידיאלי להרצה מקומית.

השימוש ב-FLUX מומלץ במיוחד כאשר נדרשת שליטה מלאה על תהליך היצירה, כאשר יש צורך בשילוב טקסט מדויק בתמונה, או כאשר רוצים להימנע מעלויות הרישוי הגבוהות של שירותים סגורים כמו Midjourney. בזכות הארכיטקטורה הפתוחה שלו, מפתחים יכולים לבצע התאמות אישיות (Fine-tuning) וליצור מודלי LoRA מותאמים בקלות יחסית.

כדי להתחיל לעבוד עם FLUX, ישנן שתי דרכים מרכזיות: שימוש בשרתי ענן מהירים כמו Replicate או fal.ai, או הרצה מקומית באמצעות ממשק ComfyUI. הרצה מקומית של גרסת ה-dev או ה-schnell דורשת כרטיס מסך חזק (מומלץ לפחות 12GB-16GB VRAM), אך ניתן להשתמש בגרסאות מכווצות (Quantized/GGUF) כדי להריץ אותם גם על חומרה ביתית סטנדרטית יותר.

הנה דוגמה קצרה להרצת FLUX.1 [schnell] באמצעות ספריית הפייתון של Replicate:

import replicate

# הפעלת המודל באמצעות ה-API של Replicate
output = replicate.run(
    "black-forest-labs/flux-schnell",
    input={
        "prompt": "A cinematic shot of a neon sign in a rainy futuristic city that reads 'AI Revolution'",
        "num_outputs": 1,
        "aspect_ratio": "16:9",
        "output_format": "webp"
    }
)

print(f"Generated image URL: {output[0]}")

לקריאה נוספת והעמקה, מומלץ לבקר במאגר הרשמי של Black Forest Labs ב-GitHub ובדף המודלים של FLUX ב-Hugging Face כדי להבין את הארכיטקטורה לעומק.

הצעד הבא שלכם: הורידו את הגרסה העדכנית של ComfyUI, הורידו את קובץ ה-Workflow הבסיסי של FLUX.1 [schnell], והריצו תמונה ראשונה באופן מקומי על המחשב שלכם.

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
03

Google Imagen ו-Veo — לראות מה ש-Google בנו

Imagen 3/4 (תמונה) ו-Veo 2/3 (וידאו) של Google DeepMind. נגישים דרך Gemini App, Vertex AI ו-Whisk. למה Imagen חזק במיוחד בטקסט בתוך תמונות.

~3 שעותמתחילים
שיעור

בשנים האחרונות, ענקיות הטכנולוגיה מתחרות על הבכורה בתחום היצירה הוויזואלית מבוססת בינה מלאכותית. חברת Google DeepMind מציגה בחזית הזו שני דגמים פורצי דרך: Imagen 3 (ליצירת תמונות) ו-Veo (ליצירת וידאו). דגמים אלו מציעים איכות פוטו-ריאליסטית יוצאת דופן, הבנה עמוקה של הנחיות טקסטואליות (prompts) ויכולת דיוק מרשימה בפרטים הקטנים ביותר.

אחד היתרונות הבולטים של Imagen 3, המבדל אותו ממתחרים רבים בשוק, הוא היכולת המדהימה שלו לשלב טקסט בתוך תמונות בצורה קריאה ומדויקת. אם בעבר יצירת שלט רחוב, עטיפת ספר או לוגו עם כיתוב ברור הייתה משימה כמעט בלתי אפשרית עבור מודלי AI, כיום Imagen מתמודד עם האתגר בקלות ומאפשר שילוב טקסט טבעי ומדויק כחלק מהקומפוזיציה הוויזואלית.

בגזרת הווידאו, מודל Veo מביא את היכולות הללו למימד הבא. Veo מסוגל לייצר סרטוני וידאו באיכות גבוהה (1080p) במגוון סגנונות קולנועיים וויזואליים. המודל מבין מושגים מעולם הקולנוע כמו "צילום רחפן" או "הילוך מהיר" (timelapse), ושומר על עקביות ויזואלית גבוהה בין הפריימים השונים - אתגר טכנולוגי עצום בעולם הווידאו הגנרטיבי.

כיצד מתחילים להשתמש בהם? הגישה למודלים הללו מונגשת בכמה רמות. משתמשי קצה יכולים להתנסות בהם ישירות דרך אפליקציית Gemini או דרך כלי היצירה הניסיוני Whisk. עבור מפתחים וארגונים, המודלים זמינים דרך פלטפורמת Vertex AI ב-Google Cloud, המאפשרת אינטגרציה פשוטה ומאובטחת באמצעות API לתוך אפליקציות קיימות.

הנה דוגמה קצרצרה לשימוש ב-Python להפקת תמונה עם Imagen 3 דרך ה-SDK של Vertex AI:

from vertexai.preview.vision_models import ImageGenerationModel

# טעינת מודל Imagen 3
model = ImageGenerationModel.from_pretrained("imagen-3.0-generate-002")

# יצירת תמונה עם טקסט ברור בתוכה
response = model.generate_images(
    prompt="A cozy neon-lit cafe at night with a sign that clearly says 'AI Cafe'",
    number_of_images=1,
    aspect_ratio="1:1"
)

# שמירת התמונה שנוצרה
response.images[0].save("ai_cafe.png")

לקריאה נוספת והעמקה בטכנולוגיה, מומלץ לבקר ב-Google DeepMind Imagen 3 וב-Google DeepMind Veo כדי לראות דוגמאות חיות ומחקרים מאחורי הקלעים.

הצעד הבא שלכם: היכנסו ל-Gemini App (או ל-Vertex AI Console אם יש לכם חשבון Google Cloud active), ונסו לבקש ממנו לייצר תמונה הכוללת שלט עם כיתוב מורכב באנגלית (למשל: "A vintage bakery with a sign saying 'Fresh Bread Today'"). בדקו בעצמכם כיצד Imagen מתמודד עם האתגר ומציג טקסט חד וברור!

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
04

OpenAI Sora, Runway Gen-4, Pika — סצנת הוידאו

Sora (OpenAI), Runway Gen-4, Pika 2.0 — שלושת הכלים שמובילים את ה-text-to-video. מה כל אחד טוב בו, מי בחינם ומי בתשלום, ואיך מחברים אותם ל-workflow.

~5 שעותבינוני
שיעור

סצנת הוידאו היא תחום מתפתח בתחום ה-AI, ובו מספר כלים מובילים כגון OpenAI Sora, Runway Gen-4 ו-Pika 2.0. כל אחד מהם מציע יכולות ייחודיות ומטרות שונות.

OpenAI Sora הוא כלי חזק שמאפשר ליצור וידאו מטקסט, והוא מבוסס על מודלי שפה מתקדמים. Runway Gen-4, מצד שני, הוא כלי שמתמחה ביצירת וידאו מטקסט, אך גם מציע יכולות נוספות כגון עריכת וידאו.

Pika 2.0 הוא כלי חדש יותר, אך הוא כבר מראה הבטחה רבה. הוא מאפשר ליצור וידאו מטקסט, וגם מציע יכולות כגון הוספת מוזיקה ואפקטים.

כדי להתחיל לעבוד עם כלים אלו, יש להתקין אותם וללמוד את התיעוד שלהם. ניתן למצוא מידע נוסף על הכלים האלו באינטרנט.

כדי להתחיל, ניתן להתחיל עם Runway Gen-4, שהוא כלי ידידותי למשתמשים ומציע יכולות רבות.

import os
from PIL import Image

# דוגמה לקוד שמשתמש ב-Runway Gen-4
def create_video(text):
    # יצירת וידאו מטקסט
    video = gen4.generate_video(text)
    return video

# הפעלת הפונקציה
video = create_video('היי, זה וידאו!')

צעד הבא: התקנת Runway Gen-4 וניסיון ליצור וידאו מטקסט.

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
05

ComfyUI — workflow visual לתמונות

הסטנדרט החדש להרצת מודלי תמונה מקומית: גרף ויזואלי של nodes (LoadModel → Sampler → VAEDecode). מתקינים פעם, רצים מאות וריאציות. תומך FLUX, SDXL, SD3.5, LoRAs.

~6 שעותבינוני
שיעור

ComfyUI — Workflow Visual לתמונות

#### מה זה ComfyUI?

ComfyUI הוא גרף ויזואלי של nodes המאפשרת הרצת מודלי תמונה מקומים. הוא תומך במספר פורמטים שונים, כולל FLUX, SDXL, SD3.5 ו-LoRAs.

#### מתי משתמשים ב-ComfyUI?

ComfyUI נועד לספק תמיכה ויזואלית למפתחים שעובדים עם מודלי תמונה. הוא מאפשר להם לראות את ה- nodes השונים, להגדיר זרימות ולבדוק את התוצאות.

#### איך מתחילים?

להתחלה, יש להתקין ComfyUI ולהגדיר את ה- nodes הרצויים. לאחר מכן, ניתן להגדיר זרימות ולבדוק את התוצאות. כדאי לצפות בדוגמאות קצרות של code block:

import comfyui

# הגדיר את ה- nodes
nodes = [LoadModel(), Sampler(), VAEDecode()]

# הגדיר את הזרימה
flow = comfyui.Flow(nodes)

# בדוק את התוצאות
flow.run()

#### קריאה מומלצת

#### צעד הבא

איזה starter project להריץ ראשון? צעד הבא הוא להתקין ComfyUI ולהגדיר את ה- nodes הרצויים. ניתן להתחיל עם ה- starter project של ComfyUI, שזמין ב-GitHub.

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
06

ControlNet ו-LoRA — שליטה מדויקת

ControlNet: שולטים בקומפוזיציה דרך edges/depth/pose maps. LoRA: מאמנים את המודל על סגנון או דמות ב-30 דק במחשב ביתי. השילוב של שניהם = יצירה ממוקדת אמיתית.

~8 שעותמתקדם
שיעור

בעולם יצירת התמונות באמצעות בינה מלאכותית יוצרת (Generative AI), מודלים בסיסיים כמו Stable Diffusion מציעים חופש יצירתי עצום, אך סובלים מחיסרון בולט: חוסר שליטה מדויקת. כאן נכנסים לתמונה שניים מהכלים החזקים ביותר באקוסיסטם: ControlNet ו-LoRA (Low-Rank Adaptation). בעוד ש-ControlNet מאפשר לנו להכתיב את הקומפוזיציה, המבנה הגיאומטרי, או תנוחת הגוף של הדמות מתוך תמונת מקור (באמצעות מפות עומק, קצוות או נקודות מפתח), LoRA מאפשר לנו להזריק למודל סגנון אמנותי ספציפי, דמות קבועה או קונספט ייחודי, וכל זאת באמצעות אימון מהיר וקל של כ-30 דקות על חומרה ביתית פשוטה.

ControlNet פועל על ידי הוספת רשתות משנה קטנות המעתיקות את משקולות המודל המקורי ומאומנות לשלב מידע מרחבי נוסף (Spatial Conditioning). לדוגמה, באמצעות מודל Canny Edge, אנו יכולים לקחת סקיצה קווית פשוטה ולהפוך אותה לתמונה ריאליסטית השומרת במדויק על קווי המתאר. מודלים נפוצים אחרים כוללים את OpenPose (לשחזור מדויק של תנוחות גוף אנושיות) ו-Depth (לשמירה על תלת-ממדיות ועומק השדה של הסצנה).

מצד שני, LoRA מציע פתרון יעיל להפליא להתאמה אישית (Fine-Tuning). במקום לאמן מחדש מיליארדי פרמטרים של מודל גדול, LoRA מוסיף מספר קטן של משקולות חדשות לשכבות הקשב (Attention Layers) של המודל. קובצי ה-LoRA הנוצרים הם קטנים במיוחד (לרוב בין 10MB ל-200MB, בניגוד למודלים מלאים השוקלים גיגה-בייטים רבים), מה שמאפשר לשתף אותם בקלות בפלטפורמות כמו Civitai ולהריץ אותם על כרטיסי מסך ביתיים סטנדרטיים.

הכוח האמיתי מתפרץ כאשר משלבים את שני הכלים יחד. דמיינו שאתם מעצבים דמות למשחק מחשב: אתם יכולים להשתמש ב-LoRA ייעודי שאימנתם על סגנון הציור של הסטודיו שלכם, ובמקביל להחיל ControlNet מסוג OpenPose כדי להכתיב לדמות בדיוק את תנוחת הלחימה הנדרשת. השילוב הזה הופך את ה-AI מכלי של "ניסוי וטעייה" לכלי עבודה מקצועי, הדיר ומדויק (Deterministic & Reproducible).

כדי להתחיל לעבוד עם הכלים הללו בצורה תכנותית, ספריית Diffusers של Hugging Face מספקת ממשק נוח ופשוט לשילוב ControlNet וטעינת משקולות LoRA:

from diffusers import StableDiffusionControlNetPipeline, ControlNetModel
import torch
from diffusers.utils import load_image

# 1. Load ControlNet and Pipeline
controlnet = ControlNetModel.from_pretrained("lllyasviel/sd-controlnet-canny", torch_dtype=torch.float16)
pipe = StableDiffusionControlNetPipeline.from_pretrained(
    "runwayml/stable-diffusion-v1-5", controlnet=controlnet, torch_dtype=torch.float16
).to("cuda")

# 2. Load LoRA weights for style
pipe.load_lora_weights("sayakpaul/sd-model-finetuned-lora-t4")

# 3. Generate image using control image
canny_image = load_image("https://huggingface.co/datasets/hf-internal-testing/diffusers-images/resolve/main/sd_controlnet/canny_edge.png")
image = pipe("a futuristic warrior, highly detailed", image=canny_image).images[0]
image.save("output.png")

להרחבת הידע, מומלץ לקרוא את המדריך הרשמי של Hugging Face ControlNet Documentation המציג את כל סוגי מפות השליטה הזמינים. בנוסף, מומלץ לבקר ב-Civitai, הפלטפורמה המובילה לגילוי והורדה של מודלי LoRA קהילתיים במגוון אינסופי של סגנונות ודמויות.

הצעד הבא שלכם: התקינו את ממשק המשתמש הפופולרי Automatic1111 Stable Diffusion WebUI או השתמשו ב-ComfyUI. הורידו מודל LoRA אחד מ-Civitai ומפת ControlNet (למשל Canny או OpenPose), ונסו לייצר דמות עקבית ב-3 תנוחות שונות לחלוטין.

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
07

ה-craft של prompt engineering לתמונה ווידאו

איך לכתוב prompt: composition keywords, style references, lighting, camera angle, negative prompts. seed re-use ל-consistency, image-to-image לעריכה, inpainting להחלפת חלקים.

~5 שעותבינוני
שיעור

יצירת תמונות ווידאו באמצעות בינה מלאכותית יוצרת (Generative AI) דורשת גישה שונה לחלוטין מכתיבת פרומפטים לטקסט. בעוד שבטקסט אנו מתמקדים בלוגיקה והוראות, בעולם הויזואלי אנו מתפקדים כבמאים, צלמים ומעצבים אמנותיים. ה"אומנות" של הנדסת פרומפטים ויזואליים (Visual Prompt Engineering) היא היכולת לתרגם חזון יצירתי לשפה מובנית שהמודל מבין, במטרה להשיג שליטה מקסימלית בתוצאה הסופית ומניעת אקראיות.

כדי להגיע לתוצאות מקצועיות, פרומפט איכותי מורכב ממספר שכבות קריטיות. ראשית, קומפוזיציה וזוויות מצלמה (כמו close-up shot או low-angle view) שמגדירות את מבנה הפריים. שנית, סגנון אמנותי (style references) כגון cyberpunk, oil painting או photorealistic. לבסוף, תאורה (lighting) כמו golden hour או neon cinematic lighting שקובעת את הטון והאווירה. שילוב מדויק של אלמנטים אלו מאפשר למודלים כמו Stable Diffusion או Midjourney להבין לא רק מה לצייר, אלא איך להציג אותו.

מעבר למה שיש בתמונה, חשוב להגדיר מה לא יהיה בה באמצעות Negative Prompts. כלי זה קריטי לסינון עיוותים נפוצים, איברים מיותרים או איכות ירודה (למשל: blurry, deformed, extra limbs). בנוסף, אחד האתגרים הגדולים ביותר ביצירת תוכן ויזואלי הוא עקביות (Consistency). שימוש חוזר באותו מספר אקראי ראשוני (seed) מאפשר לנו לשמור על מבנה בסיסי זהה של התמונה, ולבצע שינויים קלים בפרומפט מבלי לאבד את הדמות או הרקע שיצרנו.

כאשר אנו רוצים לערוך תמונות קיימות ולא רק לייצר מאפס, אנו משתמשים בטכניקות מתקדמות כמו Image-to-Image (Img2Img) המאפשרת לקחת תמונת מקור ולשנות את הסגנון שלה בהתאם לפרומפט חדש. טכניקה חזקה נוספת היא Inpainting (צביעה פנימית), שבה אנו מסמנים אזור ספציפי בתמונה (Mask) ומבקשים מהמודל להחליף רק אותו – למשל, להחליף חולצה של דמות או להוסיף משקפי שמש, תוך שמירה על שאר חלקי התמונה ללא שינוי.

לפניכם דוגמה קלאסית לשימוש בספריית diffusers של Hugging Face בפייתון, המציגה שימוש בפרומפט מובנה, פרומפט שלילי וקיבוע ה-Seed לקבלת תוצאה עקבית:

import torch
from diffusers import StableDiffusionPipeline

# טעינת המודל
pipe = StableDiffusionPipeline.from_pretrained("runwayml/stable-diffusion-v1-5", torch_dtype=torch.float16)
pipe = pipe.to("cuda")

# הגדרת הפרמטרים לשליטה מקסימלית
prompt = "A cinematic close-up of a futuristic robot, golden hour lighting, highly detailed, 8k resolution"
negative_prompt = "blurry, low quality, deformed, extra limbs"
generator = torch.Generator("cuda").manual_seed(42)  # קיבוע ה-Seed לעקביות

# הרצת הגנרציה
image = pipe(prompt, negative_prompt=negative_prompt, generator=generator).images[0]
image.save("robot_output.png")

כדי להתחיל לעבוד בצורה מקצועית וללא קוד, מומלץ להכיר את הפרויקטים המובילים בקוד פתוח בתחום זה. הפרויקט הראשון הוא Stable Diffusion WebUI by AUTOMATIC1111, ממשק המשתמש הפופולרי ביותר שמנגיש את כל היכולות הללו בצורה גרפית נוחה. פרויקט מתקדמת יותר הוא ComfyUI, המבוסס על ממשק Node-based ומאפשר בניית תהליכי עבודה (workflows) מורכבים ומדויקים במיוחד עבור תמונות ווידאו.

הצעד הבא שלכם: התקינו את ComfyUI באופן מקומי או הריצו אותו ב-Google Colab. נסו לייצר תמונה ראשונה, לשמור את ה-Seed שלה, ולאחר מכן להשתמש בטכניקת Image-to-Image כדי להפוך אותה מציור שמן לצילום ריאליסטי.

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.