יום שלישי, 15 בספטמבר 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים בונים LLM מאפס
מסלול לימוד

בונים LLM מאפס

מהמתמטיקה של attention ועד inference יעיל — בניית מודל לחלוטין משלך, שלב אחד אחרי השני.

40 שעות
6 צמתים
מתקדם
01

מבוא: איך LLM באמת עובד

tokens, embeddings, attention, layers — המנגנון שמאחורי כל מודל מודרני. הוכחה ידנית של כל שלב.

~4 שעותמתקדם
שיעור

כדי להבין באמת כיצד מודלי שפה ענקיים (LLMs) כמו Claude או Gemini מייצרים טקסט קוהרנטי, עלינו לקלף את שכבות האבסטרקטציה ולצלול למנגנון המתמטי שמניע אותם. בבסיסו, LLM אינו "חושב" במובן האנושי, אלא מתפקד כמנוע חיזוי סטטיסטי מתוחכם המבוסס על ארכיטקטורת Transformer. התהליך מתחיל ב-Tokenization, שבו טקסט חופשי מפורק ליחידות מידע בסיסיות (Tokens), אשר מתורגמות לוקטורים רב-ממדיים (Embeddings) המייצגים את המשמעות הסמנטית שלהם במרחב הגיאומטרי.

לב ה-Transformer הוא מנגנון ה-Self-Attention (קשב עצמי). מנגנון זה מאפשר לכל טוקן "להביט" על שאר הטוקנים במשפט ולחשב משקלים דינמיים המגדירים את מידת הרלוונטיות שלהם אליו. החישוב מתבצע באמצעות שלוש מטריצות: Queries (שאילתות), Keys (מפתחות) ו-Values (ערכים). מכפלת ה-Query ב-Key מייצרת ציון קשר, שעובר נרמול (Softmax) ומוכפל ב-Value. המידע המעובד הזה עובר דרך עשרות שכבות (Layers) של Feed-Forward Networks ו-Normalization, שבהן המודל מזקק ייצוגים מופשטים יותר ויותר של ההקשר. מחקרים עדכניים, כמו המחקר על בחירה אוטומטית של שכבות לזיהוי הזיות, מראים כי שכבות שונות במודל מתמחות בייצוגים שונים, וכי ניתן לזהות חוסר עקביות או הזיות על ידי ניתוח אקטיבציות בשכבות ספציפיות.

הבנת המנגנון הפנימי הזה קריטית לא רק עבור חוקרי בינה מלאכותית, אלא עבור כל מפתח שרוצה לבנות מערכות פרודקשן אמינות. כאשר אנו מעצבים ארכיטקטורות מורכבות כמו סוכני AI, אנו נתקלים במגבלות פיזיות של זיכרון ועיבוד. לדוגמה, במאמר העוסק בשאלה האם זיכרון של סוכנים הוא מסד נתונים, נבחנת הדרך שבה מודלים מאחזרים ומקודדים מידע ארוך טווח, דבר המושפע ישירות מאופן פעולת ה-Embeddings וחלון ההקשר (Context Window). בנוסף, בניתוח של הדליפה של Claude Code ניתן לראות כיצד הבנה מעמיקה של אופן פעולת המודל והאינטראקציה שלו עם סביבת העבודה מאפשרת בניית סוכנים יעילים במיוחד.

כדי להמחיש את החישוב הידני של מנגנון ה-Attention, נביט בקוד PyTorch פשוט המבצע את פעולת ה-Scaled Dot-Product Attention הבסיסית. זהו הלב הפועם של כל מודל שפה מודרני:

import torch
import torch.nn.functional as F

# 3 tokens, embedding size 4
q = torch.randn(1, 3, 4)
k = torch.randn(1, 3, 4)
v = torch.randn(1, 3, 4)

# Calculate Attention Scores
d_k = q.size(-1)
scores = torch.matmul(q, k.transpose(-2, -1)) / (d_k ** 0.5)
attention_weights = F.softmax(scores, dim=-1)

# Apply weights to Values
output = torch.matmul(attention_weights, v)
print("Output shape:", output.shape)

כדי לקחת את ההבנה הזו לשלב הבא, מומלץ לחקור פרויקטים שמממשים את התיאוריה הזו מאפס. במקום להסתמך על ספריות קצה גבוהות, התנסות מעשית בקוד פתוח תחשוף את האתגרים האמיתיים של אופטימיזציה וחישוב מבוזר.

הצעד הבא שלכם: הורידו והריצו את פרויקט nanoGPT של Karpathy. זהו מימוש נקי, קריא וקל להבנה של GPT ב-PyTorch. הריצו את קובץ ה-train.py על קובץ הטקסט של שייקספיר (ייקח לכם כ-3 דקות על GPU פשוט), ועקבו שורה אחר שורה אחרי האופן שבו ה-Embeddings, ה-Attention וה-Layers מתחברים יחד לכדי מודל שמייצר טקסט קוהרנטי מאפס. למי שרוצה לרדת לרמת החומרה ללא PyTorch כלל, מומלץ להעיף מבט ב-llm.c המממש GPT-2 ישירות ב-C/CUDA.

פרויקטי התחלה3 REPOS
nanoGPT — Karpathy
★ 41k
python מתקדם
GPT בשורות בודדות של PyTorch. רצים train.py על Shakespeare תוך 3 דקות, ויש לכם מודל עובד שאתם מבינים שורה-שורה.
git clone https://github.com/karpathy/nanoGPT && python train.py config/train_shakespeare_char.py
GitHub ↗
The Annotated Transformer
★ 6.5k
jupyter מתקדם
מאמר Attention Is All You Need עם הקוד מוטמע משפט-משפט. הדרך הקלאסית להבין transformer לעומק.
git clone https://github.com/harvardnlp/annotated-transformer
GitHub ↗
llm.c — Karpathy
★ 27k
c מתקדם
GPT-2/3 מאפס ב-C/CUDA — ללא PyTorch. minimal, fast, educational.
git clone https://github.com/karpathy/llm.c && make train_gpt2
GitHub ↗
חומרי קריאה8 פריטים
01MarkTechPost · כתבה · מתקדם
H Company משחררת NeoMME: משפחה של 260M ו-800M Single-Tower Multimodal Encoders
H Company השיקה NeoMME, משפחה של 260M ו-800M Single-Tower Multimodal Encoders שמשימתם לקצץ בפרמטרים ובחישוב.
02MIT Tech Review AI · כתבה · מתקדם
תכנון ממוריאל ואחסון בעידן ה-AI
בעידן ה-AI, יש צורך בתכנון מחדש של הארכיטקטורה כדי לאופטימיזציה של הביצועים, העיכוב, והזיכרון.
03CrewAI releases · כתבה · מתקדם
שינויים
נוספו תכונות חדשות ותוקנו באגים במערכת.
04LangChain releases · כתבה · מתקדם
langchain-anthropic==1.7.0
langchain הוציאה גרסה 1.7.0 של האינטגרציה שלהם עם Anthropic. הגרסה כוללת תמיכה ב- param עבור skills דרך container, updates thinking display mode, ותמיכה ב-1.0 SDK.
05YT AI Engineer · וידאו · מתקדם
בניית המנוע בעת שטסים: השקת שרת MCP של Figma — Jesse Lumarie, Figma
שרת MCP של Figma נבנה כפרויקט 20%, על אף שהחברה לא הייתה ידועה בפרויקטים 20%. הוא הפך לאחד מהמוצרים המהירים ביותר ש-Figma שילחה לשוק. הפרויקט כלל שימוש במודלי Gemini ובכלים כמו React ו-Tailwind. השרת MCP של Figma הציע פתרון לבעיית האספקטיביות של המודלים, ואפשר למפתחים להשתמש בו כדי לפתח אפליקציות חדשות. הפרויקט הציג גם חידושים בתחום האינטראקציה עם המודלים, כמו שימוש בפונקציות של React ובכלים כמו Tailwind.
06YT AI Engineer · וידאו · מתקדם
פיתוח סדר עבודה אגנטי ב-Uber
מערכת ה-SDLC האגנטית של Uber מאפשרת ל-70% מהבקשות להצטרף מאגנטים מקומיים או בענן, ומכפלת את כמות הקוד למהנדס. המערכת כוללת שש יחידות תשתית, כולל גשר יחיד שעובר על כל קריאה למודל, ומכילה 2,500 פעילויות בשוק המיון. המערכת גם כוללת גרף של 150 צורות וקשרים, ו-40 מיליון פריטים, שמחליף 20-30 מערכות שונות שאגנטים עבדו עליהן.
07MarkTechPost · כתבה · מתקדם
Dyna Robotics משיקה Dyna-2: מודל עולם-פעולה מוכשר על מיליון שעות וידאו אנושי
Dyna Robotics השיקה Dyna-2, מודל עולם-פעולה שהוכשר על מיליון שעות וידאו אנושי. המודל מיועד לשימוש ברובוטים ויכול לבצע משימות שונות כגון אריזה וסידור. Dyna-2 נבדק במגוון תעשיות, כולל מלונאות, מסעדנות וניקיון.
08YT AI Engineer · וידאו · מתקדם
MCP Apps: הרחבת הגבולות
MCP Apps היא דרך לשרתי MCP להחזיר ממשק משתמש אינטראקטיבי במקום בלוק טקסט. המערכת מאפשרת תקשורת ב间יימדית בין השרת ללקוח, ומאפשרת 'כתיבה פעם אחת, ריצה בכל מקום'.
02

טוקנייזר: BPE מאפס

מימוש Byte Pair Encoding משלך. הבנה איך טקסט הופך לטוקנים ולמה זה משנה.

~3 שעותמתקדם
שיעור

בעולם של מודלי שפה גדולים (LLMs), הטקסט שאנו קוראים אינו מוזן ישירות לרשת הנוירונים. במקום זאת, הוא עובר תהליך של טוקניזציה (Tokenization) – פירוק הטקסט ליחידות משמעותיות קטנות הנקראות טוקנים (Tokens). האלגוריתם הסטנדרטי והנפוץ ביותר כיום למשימה זו הוא Byte Pair Encoding (BPE). הבנת ה-BPE מאפס היא קריטית עבור מפתחי AI מתקדמים, שכן היא חושפת את "הקופסה השחורה" שבין הטקסט הגולמי לבין ה-Embeddings של המודל.

מדוע חשוב להבין ולממש BPE בעצמנו? רוב הבעיות המוזרות של מודלי שפה – כמו הקושי בהיפוך מילים, ספירת תווים או התמודדות עם שפות שאינן אנגלית – נובעות ישירות מהטוקנייזר. כאשר אנו מבינים כיצד הטוקנייזר מייצג טקסט כרצף של בייטים (Bytes) ואיך הוא ממזג אותם באופן איטרטיבי, אנו יכולים לתכנן מודלים יעילים יותר, לחסוך בעלויות הקשר (Context Window) ולמנוע באגים חמקמקים בזמן ייצור.

האלגוריתם עובד בצורה פשוטה אך גאונית: אנו מתחילים בייצוג הטקסט כרצף של בייטים בודדים (ערכים בין 0 ל-255). לאחר מכן, אנו סופרים את כל זוגות הבייטים הסמוכים הנפוצים ביותר בטקסט האימון שלנו, וממזגים את הזוג הנפוץ ביותר לטוקן חדש (למשל, מספר 256). אנו חוזרים על התהליך הזה שוב ושוב עד שאנו מגיעים לגודל המילון (Vocabulary Size) הרצוי.

הנה מימוש בסיסי בפייתון של שלב ספירת הזוגות ומיזוגם בתוך אלגוריתם BPE:

def get_stats(ids):
    counts = {}
    for pair in zip(ids, ids[1:]):
        counts[pair] = counts.get(pair, 0) + 1
    return counts

def merge(ids, pair, idx):
    newids = []
    i = 0
    while i < len(ids):
        if i < len(ids) - 1 and (ids[i], ids[i+1]) == pair:
            newids.append(idx)
            i += 2
        else:
            newids.append(ids[i])
            i += 1
    return newids

הבנה מעמיקה של טוקניזציה חיונית במיוחד כאשר עוסקים במערכות מורכבות הדורשות דיוק גבוה. לדוגמה, במחקר על אימות נוירו-סימבולי של פלטי LLM עבור דומיינים רגישי מידע, ייצוג הטוקנים משפיע ישירות על היכולת לאכוף חוקים לוגיים על הפלט. כמו כן, שינויים ועדכונים במנועי האינדוקס כמו llama-index-core 0.14.16 מדגישים את החשיבות של ניהול נכון של טקסט וטוקנים בשלבי ה-Parsing וה-Embedding של מסמכים.

הצעד הבא שלכם: כדי להבין את הנושא לעומק, מומלץ להתחיל עם הפרויקט minBPE של Karpathy. זהו מימוש מינימלי ונקי המאפשר לכם לבנות טוקנייזר משלכם (בדומה לזה של GPT-4) תוך פחות משעה. הורידו את הקוד, הריצו אותו על טקסט בעברית, וראו כיצד המילון נבנה ומייצג את השפה שלנו בצורה יעילה.

פרויקטי התחלה3 REPOS
minBPE — Karpathy
★ 9k
python מתקדם
מימוש BPE מינימלי, נקי וברור. ייצרו את ה-tokenizer של GPT/Claude משלכם תוך שעה.
git clone https://github.com/karpathy/minbpe && pip install -e .
GitHub ↗
tiktoken — OpenAI
★ 13k
rust בינוני
ה-tokenizer הרשמי של OpenAI. encode/decode מהיר ב-Rust + Python bindings.
pip install tiktoken
GitHub ↗
tokenizers — HuggingFace
★ 9k
rust בינוני
הספרייה הרשמית לטוקנייזרים. תומכת BPE, WordPiece, SentencePiece, Unigram.
pip install tokenizers
GitHub ↗
חומרי קריאה8 פריטים
01MarkTechPost · כתבה · מתקדם
Perplexity חושפת את ערימת ה-embedding הגרפית
Perplexity חושפת את המבנה הפנימי של ערימת ה-embedding הגרפית שלה, הכוללת את Ivy, Tulip ו-ROSE. החברה משתמשת ב-CUDA ו-Rust כדי לשפר ביצועים. המערכת מיועדת לשרת את pplx-embed ואת מודלי הדירוג.
02MarkTechPost · כתבה · מתקדם
webAI משחררת TwIL-LM: משפחת מודלים לוגיים פורמליים
webAI השחררה TwIL-LM, משפחת מודלים לוגיים פורמליים בגדלים 1.7B ו-3B. המודלים מיועדים לתרגום אנגלית ללוגיקה פורמלית ובדיקת תוצאות. המודלים פועלים על חומרה מקומית.
03YT AI Engineer · וידאו · בינוני
בסיסי ידע LLM: מדריך מעשי
בן הולמס מציג מדריך מעשי ליצירת בסיס ידע LLM, הכולל שימוש בדיקטה, כלים מקומיים וסינכרון עם סביבת ענן. הוא מדגים איך להשתמש ב-Claude ו-LangGraph כדי ליצור ויקי אישי.
04YT AI Engineer · וידאו · מתקדם
בניית מוצרים סביב יכולות
יכולות הן מאפיינים חדשים. יוג'נדרה מיראג'ה מ-FactSet מדבר על בניית מוצרים סביב יכולות. הוא מסביר כיצד ליצור רישום יכולות מינימלי, על החשיבות של בדיקות ואיך לנהל יכולות בקנה מידה גדול.
05YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
06YT Google DeepMind · וידאו · מתקדם
הבנת מחשבות ה-AI
חוקרים מנסים להבין את ה'מחשבות' של AI. הם חוקרים את המבנים הפנימיים של רשתות עצביות מלאכותיות, כדי ליצור AI בטוח ואמין. המחקר כולל טכניקות פרשנות ובדיקת בטיחות.
07Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
08MarkTechPost · כתבה · מתקדם
פיתוח צינור להבנת חשבוניות בעזרת lift-pdf
פיתוח צינור להבנת חשבוניות בעזרת lift-pdf. הצינור משתמש במסמכים PDF סינתטיים ובמודל להבנת מסמכים. הוא מסוגל לחלץ נתונים כגון זהות ספק, מספר הזמנה וסטטוס תשלום.
03

training loop מינימלי

אימון מודל GPT קטן על Shakespeare/Tiny Stories. forward pass, backward pass, optimizer, scheduler.

~6 שעותמתקדם
שיעור

בעולם של מודלי שפה גדולים, קל ללכת לאיבוד מאחורי ספריות עיטוף (wrappers) ברמה גבוהה כמו Hugging Face. עם זאת, כדי להבין באמת כיצד מודל GPT לומד, עלינו לצלול אל ה-training loop (לולאת האימון) המינימלית. לולאה זו היא הלב הפועם של כל תהליך למידת מכונה: היא מזינה את המודל בנתונים, מעריכה את השגיאות שלו, ומעדכנת את הפרמטרים שלו בהתאם. הבנת המכניקה הזו ברמת ה-PyTorch הבסיסית חיונית לדיבאגינג, לאופטימיזציה של ביצועים ולפיתוח ארכיטקטורות מותאמות אישית.

לולאת אימון בסיסית מורכבת מארבעה שלבים מרכזיים החוזרים על עצמם בכל איטרציה (step). השלב הראשון הוא ה-forward pass, שבו אנו מזינים את ה-tokens של הטקסט (למשל, מתוך מאגר Shakespeare או Tiny Stories) אל תוך המודל ומקבלים את ה-logits (התחזיות). מתוך ה-logits הללו אנו מחשבים את ה-loss (לרוב Cross Entropy Loss) מול ה-targets (הטוקן הבא האמיתי). מיד לאחר מכן מגיע ה-backward pass: באמצעות הקריאה ל-loss.backward(), מנוע ה-Autograd של PyTorch מחשב את הנגזרות החלקיות (הגרדיאנטים) של ה-loss ביחס לכל אחד מהפרמטרים הניתנים לאימון במודל.

לאחר חישוב הגרדיאנטים, נכנס לתמונה ה-optimizer (כמו AdamW). תפקידו לעדכן את משקולות המודל בכיוון שמפחית את ה-loss, באמצעות הפעלת optimizer.step(). לפני המעבר לאיטרציה הבאה, חובה לאפס את הגרדיאנטים בעזרת optimizer.zero_grad(set_to_none=True) כדי למנוע הצטברות לא רצויה שלהם. כדי לשפר את היציבות ואת מהירות ההתכנסות, נהוג לשלב learning rate scheduler (כמו Cosine Decay). ה-scheduler משנה את קצב הלמידה לאורך זמן: הוא מתחיל נמוך (warmup), מגיע לשיא, ואז דועך בהדרגה ככל שהאימון מתקדם.

הנה דוגמה קלאסית ומינימלית ללולאת אימון ב-PyTorch:

import torch

model.train()
optimizer = torch.optim.AdamW(model.parameters(), lr=6e-4)
scheduler = torch.optim.lr_scheduler.CosineAnnealingLR(optimizer, T_max=1000)

for step in range(max_steps):
    inputs, targets = get_batch()  # שליפת batch מתוך Shakespeare
    
    logits, loss = model(inputs, targets)  # Forward pass
    loss.backward()  # Backward pass
    
    torch.nn.utils.clip_grad_norm_(model.parameters(), max_norm=1.0)
    optimizer.step()  # Update weights
    scheduler.step()  # Update learning rate
    optimizer.zero_grad(set_to_none=True)  # Reset gradients

כדי לראות כיצד הקוד המינימלי הזה מתרחב למערכות פרודקשן אמיתיות, מומלץ לחקור את פרויקט nanoGPT של Andrej Karpathy. בקובץ train.py שלו תוכלו לראות בדיוק כיצד הלולאה הזו נבנית מאפס, כולל תמיכה ב-mixed precision (FP16/BF16) וחלוקה ל-validation. מקור מצוין נוסף להבנת הארכיטקטורה מקצה לקצה הוא הספר Build a LLM from Scratch מאת Sebastian Raschka, שמסביר צעד אחר צעד כיצד לחבר את חלקי הפאזל של ה-tokenizer, המודל ולולאת האימון.

הצעד הבא שלכם: הורידו את ה-repository של nanoGPT, הריצו את סקריפט הכנת הנתונים על קובץ ה-Shakespeare המינימלי (data/shakespeare_char/prepare.py), והפעילו את ה-training loop המקומית בעזרת train.py. עקבו אחר ירידת ה-loss בזמן אמת ונסו לשנות את ה-learning rate כדי לראות כיצד זה משפיע על קצב ההתכנסות של המודל.

פרויקטי התחלה3 REPOS
nanoGPT — training
★ 41k
python מתקדם
אותו repo כמו לעיל, אבל הפעם מתמקדים ב-train.py: data loader, optimizer, scheduler, checkpointing.
python train.py config/train_gpt2.py
GitHub ↗
TinyLlama
★ 8.5k
python מתקדם
אימון Llama 1.1B מאפס על 3 טריליון tokens. סקריפטים מלאים, פיצול multi-GPU, monitoring.
git clone https://github.com/jzhang38/TinyLlama && pip install -r requirements.txt
GitHub ↗
Sebastian Raschka — Build a LLM from Scratch
★ 50k
jupyter מתקדם
הספר המלא + קוד. כל פרק נבנה עליו את הקודם — מ-tokenizer ועד fine-tuning + DPO.
git clone https://github.com/rasbt/LLMs-from-scratch
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
טוקנים צריכים עבודות
חוקרות מ-Anthropic מציעות לתת לטוקנים עבודות שונות, כגון ייעוץ או ציון, כדי לשפר ביצועים. הן מדגימות זאת על גבי משימות ניתוח פיננסי.
02YT Nate Herk · וידאו · בינוני
איך לבחור את ה- AI Agent הנכון
בחירת ה- AI Agent הנכון לצורכיו שלך. נקודות עיקריות: חיבור ל- Claude, גמיני ו- LangGraph, ועוד.
03Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.269: תיקונים ושיפורים
Claude v0.3.269: תיקונים ושיפורים במערכת ה-Claude. תוקנו בעיות ושופרו כמה תכונות במערכת.
04Ahead of AI · כתבה · מתקדם
GPT-6 Astra, מעגלי מתמטיקה וסיבות נסתרות
GPT-6 Astra הוא מודל חדש של OpenAI, המציג ביצועים מרשימים, במיוחד בתחומי 3D ואנימציה. המודל משתמש במעגלי מתמטיקה וטכניקות חדשות לשיפור הביצועים.
05Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.265: תיקונים ושיפורים
Claude v0.3.265: תיקונים ושיפורים במערכת. נוספו תכונות לסינתטיות ולפעילות של Claude Code.
06YT AI Engineer · וידאו · מתקדם
500 יכולות, אפס עדינות: ספר ההדרכה של LinkedIn לסוכנים AI
סוכני ה-AI של LinkedIn משתמשים ב-500 יכולות ללא עדינות. הם מסתמכים על חיפוש, השגת סכמה וביצוע, ומאפשרים לסוכנים למצוא מה שהם צריכים במקום לשאת הכל בהקשר. הדבר מאפשר פתרון תקלות בדקות במקום שעות.
07YT AI Engineer · וידאו · מתקדם
גבול הזיכרון של מודלים: עלייה עשרונית בשנה
לורי ווס, ראש יחסי מפתחים ב-Arize AI, בדק מחדש בנקודת ציון ישנה מלפני שנה ומצא כי המודלים החדישים עברו את הגבול הישן בלי להיתקל בו. הוא הראה כי הגבול עלה בעשרה מונים בשנה, וכיום נמצא ליד 2,000 הוראות, ואצל המודלים הטובים ביותר - ליד 5,000.
08Claude Agent SDK (ts) · כתבה · מתקדם
Claude Agent SDK v0.3.261
נוספו תכונות ל-Claude Agent SDK, כולל שליחת פלאג-אין ותיקון בעיות בקריאת query().
04

Fine-tuning עם LoRA

מ-base model ל-assistant: SFT עם Llama/Qwen קטנים. unsloth + datasets קצרים.

~5 שעותמתקדם
שיעור

תהליך ה-Fine-tuning (כיוונון עדין) הוא השלב הקריטי שבו אנו לוקחים מודל בסיס (Base Model) כמו Llama 3 או Qwen, אשר אומן רק לנחש את המילה הבאה, והופכים אותו לעוזר אישי (Assistant) המסוגל לענות לשאלות, לעקוב אחר הוראות ולשמור על פורמט שיחה קבוע. תהליך זה נקרא Supervised Fine-Tuning (SFT), והוא מאפשר לנו להטמיע במודל סגנון דיבור ספציפי, ידע ייחודי או יכולת עבודה מדויקת עם ממשקים חיצוניים.\n\nבעבר, כיוונון מלא של מודלי שפה דרש משאבי מחשוב עצומים וכרטיסי מסך (GPUs) יקרים במיוחד. טכנולוגיית LoRA (Low-Rank Adaptation) פותרת את הבעיה הזו על ידי הקפאת משקלי המודל המקוריים והוספת מטריצות קטנות ורזות (Low-Rank) לשכבות ה-Attention. במהלך האימון אנו מעדכנים רק את המטריצות הללו, מה שמפחית את מספר הפרמטרים המאומנים בלמעלה מ-99%, חוסך זיכרון וידאו (VRAM) ומאפשר להריץ אימונים מלאים על חומרה נגישה.\n\nכדי להתחיל לעבוד בצורה המהירה ביותר, מומלץ להשתמש בספריית unsloth. היא מציעה האצה של פי 2 במהירות האימון וחיסכון של כ-70% בזיכרון ה-GPU בזכות קרנלים מותאמים אישית ב-Triton. עבור פרויקטים מורכבים יותר הדורשים אימון מבוזר על מספר כרטיסי מסך, ספריות כמו axolotl או TRL של HuggingFace יספקו את הגמישות והכלים הדרושים לניהול פייפליין האימון.\n\nהנה דוגמה קצרצרה לאימוץ מודל Llama 3 בעזרת Unsloth:\n\n``python\nfrom unsloth import FastLanguageModel\nimport torch\n\n# 1. טעינת המודל והטוקנייזר עם תמיכת LoRA מובנית\nmodel, tokenizer = FastLanguageModel.from_pretrained(\n model_name="unsloth/llama-3-8b-Instruct-bnb-4bit",\n max_seq_length=2048,\n load_in_4bit=True,\n)\n\n# 2. הגדרת פרמטרי LoRA\nmodel = FastLanguageModel.get_peft_model(\n model, \n r=16, \n target_modules=["q_proj", "k_proj", "v_proj", "o_proj"],\n lora_alpha=16,\n lora_dropout=0,\n bias="none"\n)\n``\n\nאימון מוצלח אינו דורש מיליוני דוגמאות; לעיתים קרובות, דאטהסט איכותי וממוקד של כ-1,000 דוגמאות שיחה יספיק כדי לשנות לחלוטין את התנהגות המודל. כיוונון כזה קריטי במיוחד כאשר רוצים שהמודל יתממשק בצורה אמינה עם ספריות קוד מתקדמות, למשל לצורך הפקת פלטים מובנים ב-pydantic-ai v1.98.0 או לשילובו כסוכן חכם בתוך ארכיטקטורת סוכנים מרובים כמו LangGraph 1.2.1.\n\nהצעד הבא שלכם: פתחו את אחד ממחברות ה-Colab המוכנות של unsloth, טענו דאטהסט קטן בפורמט Alpaca (למשל, הוראות ומענים של שירות לקוחות או פורמט JSON ספציפי), והריצו אימון LoRA ראשון. בתוך פחות מ-20 דקות יהיה לכם מודל מותאם אישית שתוכלו להעלות ישירות ל-HuggingFace Hub.

פרויקטי התחלה3 REPOS
unsloth
★ 22k
python מתקדם
Fine-tuning של Llama/Qwen/Mistral מהיר פי 2 וב-70% פחות זיכרון. Colab notebooks מוכנים.
pip install unsloth
GitHub ↗
axolotl
★ 8k
python מתקדם
YAML-based fine-tuning. תומך כל המודלים הפופולריים, multi-GPU, distributed, deepspeed.
pip install axolotl
GitHub ↗
TRL — Transformer RL
★ 14k
python מתקדם
הספרייה הרשמית של HuggingFace ל-SFT/DPO/PPO/GRPO. דוגמאות לכל פייפליין.
pip install trl
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
טוקנים צריכים עבודות
חוקרות מ-Anthropic מציעות לתת לטוקנים עבודות שונות, כגון ייעוץ או ציון, כדי לשפר ביצועים. הן מדגימות זאת על גבי משימות ניתוח פיננסי.
02YT Nate Herk · וידאו · בינוני
איך לבחור את ה- AI Agent הנכון
בחירת ה- AI Agent הנכון לצורכיו שלך. נקודות עיקריות: חיבור ל- Claude, גמיני ו- LangGraph, ועוד.
03Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.269: תיקונים ושיפורים
Claude v0.3.269: תיקונים ושיפורים במערכת ה-Claude. תוקנו בעיות ושופרו כמה תכונות במערכת.
04Ahead of AI · כתבה · מתקדם
GPT-6 Astra, מעגלי מתמטיקה וסיבות נסתרות
GPT-6 Astra הוא מודל חדש של OpenAI, המציג ביצועים מרשימים, במיוחד בתחומי 3D ואנימציה. המודל משתמש במעגלי מתמטיקה וטכניקות חדשות לשיפור הביצועים.
05Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.265: תיקונים ושיפורים
Claude v0.3.265: תיקונים ושיפורים במערכת. נוספו תכונות לסינתטיות ולפעילות של Claude Code.
06YT AI Engineer · וידאו · מתקדם
500 יכולות, אפס עדינות: ספר ההדרכה של LinkedIn לסוכנים AI
סוכני ה-AI של LinkedIn משתמשים ב-500 יכולות ללא עדינות. הם מסתמכים על חיפוש, השגת סכמה וביצוע, ומאפשרים לסוכנים למצוא מה שהם צריכים במקום לשאת הכל בהקשר. הדבר מאפשר פתרון תקלות בדקות במקום שעות.
07YT AI Engineer · וידאו · מתקדם
גבול הזיכרון של מודלים: עלייה עשרונית בשנה
לורי ווס, ראש יחסי מפתחים ב-Arize AI, בדק מחדש בנקודת ציון ישנה מלפני שנה ומצא כי המודלים החדישים עברו את הגבול הישן בלי להיתקל בו. הוא הראה כי הגבול עלה בעשרה מונים בשנה, וכיום נמצא ליד 2,000 הוראות, ואצל המודלים הטובים ביותר - ליד 5,000.
08Claude Agent SDK (ts) · כתבה · מתקדם
Claude Agent SDK v0.3.261
נוספו תכונות ל-Claude Agent SDK, כולל שליחת פלאג-אין ותיקון בעיות בקריאת query().
05

post-training: RLHF / DPO

איך מודל בסיס הופך ל-chat assistant. השוואת RLHF (PPO) מול DPO. TRL ב-Python.

~6 שעותמתקדם
שיעור

מודלי בסיס (Base Models) מצטיינים בניבוי הטוקן הבא על גבי קורפוס עצום של טקסט, אך הם אינם מותאמים מטבעם לשיחה אינטראקטיבית עם בני אדם. כדי להפוך מודל גולמי לעוזר אישי (Chat Assistant) מועיל, בטוח ומנומס, אנו נדרשים לשלב ה-Post-training. שלב זה מתמקד בהתאמת התנהגות המודל להעדפות אנושיות (Alignment), ומבוצע לרוב באמצעות שיטות של למידת חיזוק (Reinforcement Learning) או אופטימיזציה ישירה של העדפות.

השיטה הקלאסית, RLHF (שמבוססת לרוב על אלגוריתם PPO), דורשת אימון של מודל תגמול (Reward Model) נפרד שמדרג את תשובות המודל, ולאחר מכן הרצת לולאת RL מורכבת לעדכון המודל היוצר (Actor). תהליך זה נוטה לחוסר יציבות וצורך משאבי חישוב אדירים. לעומתה, שיטת DPO (Direct Preference Optimization) חוללה מהפכה בכך שהיא מייתרת את מודל התגמול ואת לולאת ה-RL. DPO מגדירה פונקציית הפסד (Loss) ישירה על זוגות של העדפות (תשובה מועדפת מול תשובה דחויה), ומאפשרת אופטימיזציה יציבה ומהירה בהרבה, הדומה לאימון מפוקח (SFT) רגיל.

עם זאת, הבחירה בין השתיים אינה חד-משמעית. בעוד ש-DPO מצוינת למשימות סגנון והעדפה כללית, מחקרים מראים כי במשימות חשיבה מורכבות ודיאלוגים רב-סבביים, למידת חיזוק אינטראקטיבית עדיין מחזיקה ביתרון משמעותי. לדוגמה, במאמר מאימון סטטי ל-RL אינטראקטיבי מכויל: הפחתת היסט התפלגות בדיאלוג רב-סבבים מוסבר כיצד RL אינטראקטיבי מפחית את היסט ההתפלגות (Distribution Shift) בשיחות ארוכות. כמו כן, מחקרים כמו עומק חשיבה ומורכבות סביבה מראים כיצד שילוב של סביבות למידה מבוססות כללים (RLVR) חיוני לפיתוח יכולות חשיבה לוגית מתקדמות במודלים.

כדי ליישם שיטות אלו בפועל, ספריית TRL (Transformer Reinforcement Learning) מבית Hugging Face מציעה פתרון אינטגרטיבי ונוח. הספרייה מספקת מחלקות ייעודיות כמו DPOTrainer ו-PPOTrainer המאפשרות לבצע את תהליך ה-Alignment בכמה שורות קוד בודדות, תוך תמיכה בטכניקות יעילות זיכרון כמו LoRA ו-DeepSpeed.

להלן דוגמה בסיסית להגדרת אימון DPO באמצעות TRL ב-Python:

from transformers import AutoModelForCausalLM, AutoTokenizer
from trl import DPOTrainer, DPOConfig
from datasets import load_dataset

model = AutoModelForCausalLM.from_pretrained("gpt2")
ref_model = AutoModelForCausalLM.from_pretrained("gpt2")
tokenizer = AutoTokenizer.from_pretrained("gpt2")
tokenizer.pad_token = tokenizer.eos_token
dataset = load_dataset("Anthropic/hh-rlhf", split="train[:100]")

training_args = DPOConfig(output_dir="./dpo_results", beta=0.1, max_length=512)
trainer = DPOTrainer(model, ref_model, args=training_args, train_dataset=dataset, tokenizer=tokenizer)
trainer.train()

הצעד הבא שלכם: כדי להתחיל להתנסות, מומלץ לשכפל את מאגר הקוד של TRL ולהריץ את סקריפט ה-DPO המובנה (examples/scripts/dpo.py) על גבי דאטהסט קטן כמו Anthropic/hh-rlhf. אם אתם מכוונים לאימון מודלים ענקיים על גבי מספר כרטיסי מסך, כדאי לבחון את OpenRLHF המציע תשתית מבוזרת ויציבה המשלבת את Ray ו-DeepSpeed.

פרויקטי התחלה3 REPOS
TRL — DPO/PPO examples
★ 14k
python מתקדם
examples/scripts כולל dpo.py ו-ppo.py מוכנים להרצה.
pip install trl && cd trl/examples
GitHub ↗
OpenRLHF
★ 6.5k
python מתקדם
פריימוורק RLHF גמיש ויעיל. תומך PPO, DPO, GRPO על מספר GPU עם Ray + DeepSpeed.
pip install openrlhf
GitHub ↗
verl
★ 8k
python מתקדם
הפריימוורק החדש של ByteDance ל-RL post-training. מסוגל GRPO על LLMs ענקיים.
git clone https://github.com/volcengine/verl
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
חור: סוכני תקיפה לבדיקת חוסר צדקות שלך — Brendan Rappazzo, Morgan Stanley
Loophole היא טכנולוגיה שמשתמשת בסוכני תקיפה כדי לבדוק את הצדקות שלך ולמצוא חורים בחוק. היא נוצרה על ידי Brendan Rappazzo, מחקרן ללמידת מכונה ב-Morgan Stanley. הפרויקט הושק כפרויקט פתוח, ואינו קשור לעבודתו של Rappazzo ב-Morgan Stanley.
02YT Nate Herk · וידאו · בינוני
איך לבחור את ה- AI Agent הנכון
בחירת ה- AI Agent הנכון לצורכיו שלך. נקודות עיקריות: חיבור ל- Claude, גמיני ו- LangGraph, ועוד.
03YT AI Engineer · וידאו · מתקדם
MCP Apps: תרגם את המודל, נתן למשתמש UI — Dustin Mihalik, Indeed
הוספת UI ל- MCP Apps עשויה להפגע באיכות המוצר, כיוון שהמודל עשוי לעצור לפני שהוא חוקר את כל האפשרויות.
04YT AI Engineer · וידאו · מתקדם
טוקן, טוקן, טוקן: איך RLMs שונים — Kevin Madura, AlixPartners
RLMs שונים ממודלי השפה הרגילים ביכולתם לפרק משימות מורכבות ולהעביר את התפקיד למודלים תתי-מודל. הם יכולים לטפל במשימות כמו קיבוע חשבונות, זיהוי תבניות בלוגים ואופטימיזציה של חריגות. זה יכול להיות יעיל יותר מאשר RAG, כאשר כל הפעולות נעשות באותו מסגרת.
05Interconnects · כתבה · מתקדם
הארטיפקטים הפתוחים האחרונים: Motif-3, GLM-5.3, Hy4-Preview ורישיונות מודל
ארטיפקטים פתוחים חדשים: Motif-3, GLM-5.3, Hy4-Preview ורישיונות מודל. חברות גדולות כגון Google ו-Meta החלו להשתמש ברישיונות פתוחים, בעוד חברות סיניות נוטות לרישיונות מוגבלים.
06Latent Space · כתבה · בינוני
OpenClaw Power, MacBook Simplicity: חמשה ימים עם Grok Bot
Grok Bot מציע קלות יוצאת דופן בהתקנת AI, עם התחברות באמצעות הדפדפן וניהול כרטיסי פלוגין.
07MIT Tech Review AI · כתבה · מתקדם
תכנון ממוריאל ואחסון בעידן ה-AI
בעידן ה-AI, יש צורך בתכנון מחדש של הארכיטקטורה כדי לאופטימיזציה של הביצועים, העיכוב, והזיכרון.
08YT Cole Medin · וידאו · מתקדם
מפעלי תוכנה AI: הדבר הבא בטכנולוגיה (ואני בונה אותך)
מפעל תוכנה AI לבניית והפצת מודלי AI. פרויקט זה מאפשר לבנות ולהפיץ מודלי AI באופן יעיל ומהיר. הפרויקט כולל כלי לבניית מודלי AI, כלי להפצת מודלי AI וכלי לניהול מודלי AI. הפרויקט נועד לספק פתרון לבעיות הקשורות לבניית והפצת מודלי AI.
06

Inference יעיל — KV cache, sampling, quantization

אופטימיזציות שמשנות סדרי גודל בביצועים: KV cache, beam vs greedy vs nucleus, INT8/4 quantization.

~4 שעותמתקדם
שיעור

הרצת מודלי שפה גדולים (LLMs) בסביבת פרודקשן מציבה אתגרים עצומים של זיכרון ורוחב פס (Memory Bandwidth). בניגוד לשלב האימון (Training) שבו החישובים מתבצעים במקביל, שלב ה-Inference הוא אוטורגרסיבי (Auto-regressive) – המודל מייצר טוקן אחר טוקן, כאשר כל טוקן חדש דורש חישוב מחדש של כל ההקשר שקדם לו. כדי למנוע צווארי בקבוק אלו ולשפר את ה-Throughput ואת ה-Latency בסדרי גודל, אנו משתמשים בשלוש טכניקות אופטימיזציה מרכזיות: KV cache, Sampling מתקדם ו-Quantization (קוונטיזציה).

הטכניקה הבסיסית והחשובה ביותר היא KV cache (Key-Value cache). בכל צעד של יצירת טוקן, מנגנון ה-Attention צריך לחשב את ה-Keys וה-Values עבור כל הטוקנים הקודמים. במקום לחשב אותם מחדש בכל טוקן חדש (מה שיוצר סיבוכיות של $O(N^2)$ בזמן החישוב), אנו שומרים את ה-Keys וה-Values של הטוקנים הקודמים בזיכרון ה-GPU. פרויקטים מתקדמים כמו vLLM לקחו את זה צעד קדימה עם PagedAttention, המנהל את זיכרון ה-KV cache בדומה לניהול זיכרון וירטואלי במערכות הפעלה, ובכך מונע פרגמנטציה ומאפשר Batching דינמי ויעיל במיוחד.

כדי להתמודד עם מגבלת הזיכרון הפיזי (VRAM), אנו משתמשים ב-Quantization (דחיסת משקולות). מודלים מיוצגים במקור בפורמט FP16 או BF16 (שני בייטים לפרמטר). קוונטיזציה ל-INT8 או INT4 מאפשרת לדחוס את משקולות המודל פי 2 עד 4, כמעט ללא פגיעה בדיוק המודל. כלי כמו llama.cpp מאפשר להריץ מודלים ענקיים על חומרת קצה (כמו מעבדי Apple Silicon או אפילו CPU פשוט) בזכות מימוש יעיל במיוחד של קוונטיזציות מסוג GGUF.

היבט נוסף המשפיע על יעילות ואיכות ה-Inference הוא אסטרטגיית ה-Sampling. בעוד ש-Greedy Search בוחר תמיד את הטוקן בעל ההסתברות הגבוהה ביותר (מה שעלול להוביל ללולאות חזרתיות), ו-Beam Search שומר מספר מסלולים במקביל (יקר חישובית), שיטות מודרניות כמו Nucleus Sampling (Top-p) ו-Top-k מספקות את האיזון המושלם. הן מסננות את מרחב הטוקנים האפשריים בזמן אמת, ובכך חוסכות משאבי חישוב ומייצרות טקסט טבעי ומגוון יותר.

הנה דוגמה פשוטה לשימוש ב-vLLM להרצת Inference מהיר במיוחד עם הגדרות Sampling מתקדמות:

from vllm import LLM, SamplingParams

# אתחול המודל עם תמיכה מובנית ב-PagedAttention ו-KV cache אופטימלי
llm = LLM(model="facebook/opt-125m")

# הגדרת פרמטרי Sampling ליצירת טקסט איכותי ויעיל
sampling_params = SamplingParams(
    temperature=0.7,
    top_p=0.9,
    max_tokens=100
)

prompts = ["The future of AI inference is"]
outputs = llm.generate(prompts, sampling_params)

for output in outputs:
    print(f"Generated text: {output.outputs[0].text}")

הבנת האופטימיזציות האלו קריטית כאשר בונים מערכות AI מקומיות או מבוזרות. לדוגמה, בפודקאסט יצירת עוזר AI פרטי ב-Thunderbird נידונה החשיבות של הרצת מודלים מקומיים ביעילות על חומרת קצה מוגבלת. כמו כן, הדינמיקה בין מודלים פתוחים לסגורים, כפי שמתואר בפרק האגדה על מלחמות המודלים: פתוח vs סגור ב-2026, מושפעת ישירות מהיכולת של הקהילה להריץ מודלים פתוחים ביעילות מקומית באמצעות טכנולוגיות כמו llama.cpp ו-vLLM.

הצעד הבא שלך: כדי לחוות את עוצמת האופטימיזציה בעצמך, התקן את llama.cpp על המחשב האישי שלך. הורד מודל בפורמט GGUF (למשל Llama 3 בקוונטיזציה של Q4_K_M) והרד אותו דרך הטרמינל. שים לב להבדל במהירות ה-Inference (טוקנים לשנייה) בהשוואה להרצה של מודל לא מכווץ, וראה כיצד ה-KV cache המובנה שומר על ביצועים יציבים גם ככל שהצ'אט מתארך.

פרויקטי התחלה3 REPOS
vLLM
★ 35k
python מתקדם
ה-inference engine המוביל. PagedAttention, continuous batching, throughput x10 מ-HF transformers.
pip install vllm && vllm serve meta-llama/Llama-3.3-70B-Instruct
GitHub ↗
gpt-fast — PyTorch
★ 6k
python מתקדם
PyTorch native, ~1000 שורות, ביצועים תחרותיים. נקודת התחלה ללמוד KV cache + sampling.
git clone https://github.com/pytorch-labs/gpt-fast
GitHub ↗
llama.cpp
★ 70k
cpp מתקדם
C++ נטו, רץ על CPU/Metal/CUDA. quantization, KV cache, embed everywhere.
git clone https://github.com/ggerganov/llama.cpp && make
GitHub ↗
חומרי קריאה8 פריטים
01Vercel AI SDK · כתבה · מתקדם
פיצ' זי: @ai-sdk/zai@3.0.10
נערכו תלותיות ב@ai-sdk/zai@3.0.10
02Vercel AI SDK · כתבה · מתקדם
XAI 4.0.58: תיקון תמיכה לבקשות קבוצה לא תואמות
XAI 4.0.58: תיקון לבקשות קבוצה לא תואמות. התוסף תומך כעת בבקשות ייצור תמונות בקבוצות.
03Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/tui@1.0.99
עודכן תלותיות ב @ai-sdk/tui לגרסה 1.0.99. העדכון כולל עדכון של תלותיות באי-סדק.
04LangChain releases · כתבה · מתקדם
langchain-openai==1.6.2
langchain-openai==1.6.2: הוספת ניסיונות תגובה של GPT-6 Astra
05YT Nate Herk · וידאו · כללי
תודה ל-1,000,000 מנויים
יוצר יוצא ל-1,000,000 מנויים, 2 שנים לאחר שפרסם את הסרטון הראשון שלו. הוא תודה לקהל שלו ולכל האנשים שעזרו לו להגיע למאזן הזה.
06Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/zai@3.0.7
עודכן תלותיות @ai-sdk/zai@3.0.7, כולל @ai-sdk/provider@4.0.11, @ai-sdk/provider-utils@5.0.37 ו@ai-sdk/openai-compatible@3.0.45
07Vercel AI SDK · כתבה · מתקדם
XAI 4.0.55: תמיכה במודלים לפי בקשה ב batch
XAI 4.0.55 תומכת במודלים לפי בקשה ב batch. נעשו גם עדכוני תלות.
08Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/workflow@2.0.25
עודכן תלותיות ב @ai-sdk/workflow@2.0.25. עודכן ai@7.0.94, @ai-sdk/provider@4.0.11 ו-@ai-sdk/provider-utils@5.0.37.