Meta AI ו-Llama — האם הקוד הפתוח ינצח?
מפת ה-AI של Meta: Llama 1/2/3/4, Yann LeCun, FAIR vs GenAI, PyTorch, Imagebind, Segment Anything. הימור הענק של Zuckerberg על open source.
Meta AI — מ-FAIR ל-Llama 4
FAIR (2013), המעבר ל-GenAI org, Llama 1 (Feb 2023 leak), Llama 2 commercial open, Llama 3 (multimodal), Llama 4. אסטרטגיית Zuckerberg של $65B/year ב-AI.
חברת Meta (לשעבר Facebook) עברה מסלול מרתק שהפך אותה לאחת השחקניות המשפיעות ביותר בעולם ה-AI היוצר (Generative AI). הכל התחיל בשנת 2013 עם הקמת FAIR (Facebook AI Research) בהובלת פרופ' יאן לקון (Yann LeCun), במטרה לקדם את מחקר ה-AI הבסיסי בגישה פתוחה ואקדמית. לאורך שנים, FAIR תרמה לעולם פרויקטים פורצי דרך כמו PyTorch, אך פריצת הדרך של ChatGPT בסוף 2022 אילצה את החברה לבצע שינוי מבני מהיר. Meta הקימה חטיבת GenAI ייעודית שנועדה לתרגם את המחקר האקדמי למוצרים צרכניים ולשנות את חוקי המשחק בתעשייה.
השינוי הגדול החל בפברואר 2023 עם הדלפת המשקולות של Llama 1. למרות שהמודל שוחרר במקור למטרות מחקר בלבד, ההדלפה שלו הציתה את מהפכת הקוד הפתוח ב-LLMs. כמה חודשים לאחר מכן, Meta שחררה את Llama 2 עם רישיון מסחרי מתירני, מה שאפשר לחברות וסטארטאפים לבנות יישומים מסחריים ללא תלות ב-APIs סגורים. עם שחרורו של Llama 3 (ולאחר מכן Llama 3.1 ו-3.2), המודל הפך למולטי-מודאלי (Multimodal) והציג ביצועים שהשתוו ואף עקפו מודלים מסחריים מובילים כמו GPT-4 במדדים רבים. כיום, העיניים נשואות אל עבר Llama 4, שצפוי להציג יכולות תכנון והסקה (Reasoning) מתקדמות במיוחד.
מאחורי האסטרטגיה הזו עומד חזון אגרסיבי של מארק צוקרברג (Mark Zuckerberg), הכולל השקעות עתק של כ-65 מיליארד דולר בשנה בתשתיות מחשוב ורכישת מאות אלפי מעבדי H100 של Nvidia. מדוע Meta משקיעה סכומי עתק ומפיצה את המודלים בחינם? התשובה טמונה באסטרטגיית ה-Open Source: על ידי הפיכת Llama לסטנדרט התעשייתי, Meta מונעת ממתחרות כמו Google ו-Apple לשלוט ב"מערכת ההפעלה" של ה-AI, ונהנית משיפורים קהילתיים חינמיים שמייעלים את המודלים שלה. כפי שמתואר בניתוח על מערכות אקולוגיות של מודלים פתוחים: יתרון סיני? — Interconnects, היתרון של קוד פתוח הוא ביכולת שלו לצבור תאוצה קהילתית (compounding effect) שקשה מאוד למתחרים סגורים להדביק. בנוסף, מגמה זו משפיעה על ארגונים רבים המפתחים ארכיטקטורות היברידיות חדשות, כפי שניתן לראות בכתבה על Olmo Hybrid ומבני LLM עתידיים — Interconnects.
כדי להתחיל לעבוד עם משפחת מודלי Llama באופן מקומי (Local AI), הדרך הפשוטה ביותר היא שימוש בכלי כמו Ollama, המאפשר להריץ מודלים ישירות על המחשב האישי שלכם. הנה דוגמה קצרה בקוד Python המראה כיצד לפנות למודל Llama 3 המורץ מקומית:
import requests
# פנייה לשרת המקומי של Ollama המריץ את Llama 3
url = "http://localhost:11434/api/generate"
payload = {
"model": "llama3",
"prompt": "הסבר בקצרה מה ההבדל בין מודל פתוח למודל סגור ב-AI",
"stream": False
}
response = requests.post(url, json=payload)
if response.status_code == 200:
print(response.json().get("response"))
else:
print("שגיאה בחיבור למודל המקומי")
הצעד הבא שלכם הוא להתקין את Ollama על המחשב שלכם, להוריד את המודל באמצעות הפקודה ollama run llama3 במערכת ההפעלה, ולהריץ את קוד ה-Python שלמעלה. זוהי נקודת פתיחה מצוינת להבנת הכוח של מודלים פתוחים ומקומיים ללא צורך בתשלום על APIs חיצוניים.
משפחת Llama — Llama 4 ו-Behemoth
Llama 3.1/3.2/3.3 ו-Llama 4 (Scout/Maverick/Behemoth). Mixture-of-Experts, multimodal, fine-tuning ב-Hugging Face. מתי לבחור Llama על פני GPT/Claude.
משפחת מודלי Llama של Meta חוללה מהפכה בעולם ה-AI, כשהיא מנגישה מודלים ברמת קצה במשקלים פתוחים (Open-weights). בעוד שגרסאות Llama 3.1, 3.2 ו-3.3 ביססו את מעמדן עם תמיכה במולטי-מודאליות (Multimodal) ומודלים קומפקטיים למובייל, העיניים נשואות כעת לדור הבא: Llama 4, הכולל גרסאות מותאמות כמו Scout ו-Maverick, ועד לענק ה-Mixture-of-Experts (MoE) המכונה Behemoth. מודלים אלו מציעים ביצועים שמתחרים ישירות במודלים הסגורים המובילים בשוק.
מדוע לבחור ב-Llama על פני ענקים סגורים כמו GPT של OpenAI או Claude של Anthropic? התשובה טמונה בשליטה, פרטיות והתאמה אישית. בעוד שמודלים סגורים דורשים שליחת מידע רגיש לענן ומשיתים עלויות קבועות לכל קריאת API, משפחת Llama מאפשרת הרצה מקומית (On-premise) וביצוע Fine-tuning מדויק על דאטה ארגוני. כפי שמתואר בניתוח על מערכות אקולוגיות של מודלים פתוחים, היתרון הגדול של קוד פתוח הוא האפקט המצטבר של קהילת המפתחים שמשפרת את כלי ההרצה והאופטימיזציה ללא הפסקה.
מבחינה ארכיטקטונית, המעבר למודלי MoE (כמו ב-Behemoth) מאפשר להפעיל רק חלק קטן מהפרמטרים עבור כל טוקן, מה שמוזיל דרמטית את עלויות החישוב ומגביר את מהירות התגובה. מגמה זו של שילוב ארכיטקטורות מתקדמות נדונה בהרחבה במאמר על Olmo Hybrid ומבני LLM עתידיים, המציג כיצד התעשייה נעה לעבר מודלים היברידיים יעילים יותר.
כדי להתחיל לעבוד עם Llama, הדרך הפשוטה ביותר היא שימוש בספריית Transformers של Hugging Face או הרצה מקומית קלה בעזרת Ollama. הנה דוגמה קצרצרה לטעינה והרצה של מודל Llama 3.2 קל משקל באמצעות Hugging Face בפייתון:
from transformers import pipeline
import torch
# טעינת מודל Llama 3.2 קומפקטי למשימות טקסט
generator = pipeline(
"text-generation",
model="meta-llama/Llama-3.2-3B-Instruct",
torch_dtype=torch.bfloat16,
device_map="auto"
)
prompt = "Explain the difference between MoE and Dense models in one sentence."
outputs = generator(prompt, max_new_tokens=50)
print(outputs[0]["generated_text"])
האקוסיסטם סביב מודלים פתוחים ממשיך להתרחב במהירות עצומה, כפי שניתן לראות בסקירה של האמצעים הפתוחים (#20), המציגה שחקנים חדשים וסוגי מודלים מתקדמים שמצטרפים למרוץ. פיתוחים אלו מאפשרים לארגונים לבנות יישומים מורכבים המשלבים סוכני AI עצמאיים המבוססים על תשתית פתוחה לחלוטין.
הצעד הבא שלכם: כדי להתחיל להתנסות באופן מעשי, אנו ממליצים להוריד ולהתקין את פרויקט Ollama במחשב המקומי שלכם, ולהריץ את הפקודה ollama run llama3.2 בטרמינל. זה יאפשר לכם להריץ מודל Llama מקומי תוך פחות מ-5 דקות ולחבר אותו לכל אפליקציה או סוכן AI שתפתחו.
יאן לקון — חזון ה-AI החופשי
Yann LeCun ככומר של open AI, ה-debate מול Hinton/Bengio על existential risk, JEPA + V-JEPA כחלופה ל-LLMs, ה-world models. דעות חדות, לעיתים שערורייתיות.
יאן לקון (Yann LeCun), המדען הראשי של Meta ואחד מ"אבות הלמידה העמוקה", מייצג קול ייחודי ומשפיע במיוחד בתעשיית ה-AI. בעוד שחברות רבות נוטות לסגור את המודלים שלהן מאחורי ממשקי API מסחריים, לקון מוביל את חזון ה-Open Source AI. הוא מאמין שבינה מלאכותית צריכה להיות פתוחה ונגישה לכל, וכי ניסיונות להגביל את הגישה לקוד ולמשקלים של המודלים רק יחזקו מונופולים טכנולוגיים ויעכבו את המחקר המדעי העולמי.
עמדתו הבלתי מתפשרת של לקון מציבה אותו במסלול התנגשות ישיר עם עמיתיו לפרס טיורינג, ג'פרי הינטון (Geoffrey Hinton) ויהושע בנג'יו (Yoshua Bengio). בעוד שהם מזהירים מפני "סיכון קיומי" (Existential Risk) ואפשרות שה-AI יביא להכחדת האנושות, לקון פוטר טענות אלו כלא מציאותיות. לטענתו, המודלים הנוכחיים רחוקים אפילו מאינטליגנציה של חתול, ודיבורים על אפוקליפסה מסיטים את הקשב מבעיות אמיתיות של בטיחות ונגישות. דיונים אלו על קשיי הפיקוח ותמחור סיכוני ההכחדה מנותחים בהרחבה ב-Import AI 459.
מעבר לוויכוח הפילוסופי, לקון מציג ביקורת טכנולוגית נוקבת על מודלי שפה גדולים (LLMs) מבוססי Autoregressive (כמו GPT-4 או Claude). הוא טוען שמודלים אלו, המנבאים רק את הטוקן הבא, סובלים מאי-יציבות מובנית, חוסר הבנה של העולם הפיזיקלי ונטייה להזיות (Hallucinations). כחלופה, לקון מציע את קונספט ה-World Models (מודלי עולם) – מערכות שמסוגלות להבין כיצד העולם הפיזיקלי פועל, לתכנן פעולות ולחזות תוצאות ברמת הפשטה גבוהה, בדומה לדרך שבה בני אדם ובעלי חיים לומדים ופועלים במרחב. נושאים אלו עולים לעיתים קרובות גם בראיונות עומק מורכבים כמו אלו של YT Lex Fridman.
היישום המעשי של חזון זה הוא ארכיטקטורת JEPA (Joint Embedding Predictive Architecture). בניגוד למודלים גנרטיביים שמנסים לשחזר כל פיקסל או מילה (משימה בזבזנית ביותר), JEPA לומדת להשוות ייצוגים מופשטים (Embeddings) של קלטים. גרסת הוידאו שלה, V-JEPA, מאפשרת למודל להבין תנועה, סיבתיות ואינטראקציות פיזיקליות מתוך צפייה בווידאו בלבד, ללא צורך בתוויות אנושיות או חיזוי פיקסל-אחר-פיקסל.
כדי להבין את העיקרון של Joint Embedding, נוכל לבחון קוד פשוט ב-PyTorch המדגים השוואה בין שני ייצוגים של קלטים שונים (למשל, שתי זוויות ראייה של אותו אובייקט) באמצעות Loss פשוט המעודד קרבה במרחב הוקטורי:
import torch
import torch.nn as nn
class SimpleJEPA(nn.Module):
def __init__(self, input_dim, embed_dim):
super().__init__()
self.encoder_x = nn.Sequential(nn.Linear(input_dim, embed_dim), nn.ReLU())
self.encoder_y = nn.Sequential(nn.Linear(input_dim, embed_dim), nn.ReLU())
def forward(self, x, y):
# הפקת ייצוגים מופשטים לשני הקלטים
rep_x = self.encoder_x(x)
rep_y = self.encoder_y(y)
# חישוב מרחק במרחב הייצוגים (L2 Loss)
loss = torch.mean((rep_x - rep_y) ** 2)
return loss
כדי להתחיל לעבוד עם הרעיונות הללו באופן מעשי, מומלץ לחקור את הפרויקטים הפתוחים של Meta AI. הצעד הבא שלכם הוא להוריד ולהריץ את פרויקט ה-V-JEPA הרשמי מ-GitHub, המאפשר לאמן מודלים להבנת וידאו ללא פיקוח אנושי, ומהווה את אבן הפינה הנוכחית בחזון מודלי העולם של יאן לקון.