יום שישי, 31 ביולי 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים בונים LLM מאפס
מסלול לימוד

בונים LLM מאפס

מהמתמטיקה של attention ועד inference יעיל — בניית מודל לחלוטין משלך, שלב אחד אחרי השני.

40 שעות
6 צמתים
מתקדם
01

מבוא: איך LLM באמת עובד

tokens, embeddings, attention, layers — המנגנון שמאחורי כל מודל מודרני. הוכחה ידנית של כל שלב.

~4 שעותמתקדם
שיעור

כדי להבין באמת כיצד מודלי שפה ענקיים (LLMs) כמו Claude או Gemini מייצרים טקסט קוהרנטי, עלינו לקלף את שכבות האבסטרקטציה ולצלול למנגנון המתמטי שמניע אותם. בבסיסו, LLM אינו "חושב" במובן האנושי, אלא מתפקד כמנוע חיזוי סטטיסטי מתוחכם המבוסס על ארכיטקטורת Transformer. התהליך מתחיל ב-Tokenization, שבו טקסט חופשי מפורק ליחידות מידע בסיסיות (Tokens), אשר מתורגמות לוקטורים רב-ממדיים (Embeddings) המייצגים את המשמעות הסמנטית שלהם במרחב הגיאומטרי.

לב ה-Transformer הוא מנגנון ה-Self-Attention (קשב עצמי). מנגנון זה מאפשר לכל טוקן "להביט" על שאר הטוקנים במשפט ולחשב משקלים דינמיים המגדירים את מידת הרלוונטיות שלהם אליו. החישוב מתבצע באמצעות שלוש מטריצות: Queries (שאילתות), Keys (מפתחות) ו-Values (ערכים). מכפלת ה-Query ב-Key מייצרת ציון קשר, שעובר נרמול (Softmax) ומוכפל ב-Value. המידע המעובד הזה עובר דרך עשרות שכבות (Layers) של Feed-Forward Networks ו-Normalization, שבהן המודל מזקק ייצוגים מופשטים יותר ויותר של ההקשר. מחקרים עדכניים, כמו המחקר על בחירה אוטומטית של שכבות לזיהוי הזיות, מראים כי שכבות שונות במודל מתמחות בייצוגים שונים, וכי ניתן לזהות חוסר עקביות או הזיות על ידי ניתוח אקטיבציות בשכבות ספציפיות.

הבנת המנגנון הפנימי הזה קריטית לא רק עבור חוקרי בינה מלאכותית, אלא עבור כל מפתח שרוצה לבנות מערכות פרודקשן אמינות. כאשר אנו מעצבים ארכיטקטורות מורכבות כמו סוכני AI, אנו נתקלים במגבלות פיזיות של זיכרון ועיבוד. לדוגמה, במאמר העוסק בשאלה האם זיכרון של סוכנים הוא מסד נתונים, נבחנת הדרך שבה מודלים מאחזרים ומקודדים מידע ארוך טווח, דבר המושפע ישירות מאופן פעולת ה-Embeddings וחלון ההקשר (Context Window). בנוסף, בניתוח של הדליפה של Claude Code ניתן לראות כיצד הבנה מעמיקה של אופן פעולת המודל והאינטראקציה שלו עם סביבת העבודה מאפשרת בניית סוכנים יעילים במיוחד.

כדי להמחיש את החישוב הידני של מנגנון ה-Attention, נביט בקוד PyTorch פשוט המבצע את פעולת ה-Scaled Dot-Product Attention הבסיסית. זהו הלב הפועם של כל מודל שפה מודרני:

import torch
import torch.nn.functional as F

# 3 tokens, embedding size 4
q = torch.randn(1, 3, 4)
k = torch.randn(1, 3, 4)
v = torch.randn(1, 3, 4)

# Calculate Attention Scores
d_k = q.size(-1)
scores = torch.matmul(q, k.transpose(-2, -1)) / (d_k ** 0.5)
attention_weights = F.softmax(scores, dim=-1)

# Apply weights to Values
output = torch.matmul(attention_weights, v)
print("Output shape:", output.shape)

כדי לקחת את ההבנה הזו לשלב הבא, מומלץ לחקור פרויקטים שמממשים את התיאוריה הזו מאפס. במקום להסתמך על ספריות קצה גבוהות, התנסות מעשית בקוד פתוח תחשוף את האתגרים האמיתיים של אופטימיזציה וחישוב מבוזר.

הצעד הבא שלכם: הורידו והריצו את פרויקט nanoGPT של Karpathy. זהו מימוש נקי, קריא וקל להבנה של GPT ב-PyTorch. הריצו את קובץ ה-train.py על קובץ הטקסט של שייקספיר (ייקח לכם כ-3 דקות על GPU פשוט), ועקבו שורה אחר שורה אחרי האופן שבו ה-Embeddings, ה-Attention וה-Layers מתחברים יחד לכדי מודל שמייצר טקסט קוהרנטי מאפס. למי שרוצה לרדת לרמת החומרה ללא PyTorch כלל, מומלץ להעיף מבט ב-llm.c המממש GPT-2 ישירות ב-C/CUDA.

פרויקטי התחלה3 REPOS
nanoGPT — Karpathy
★ 41k
python מתקדם
GPT בשורות בודדות של PyTorch. רצים train.py על Shakespeare תוך 3 דקות, ויש לכם מודל עובד שאתם מבינים שורה-שורה.
git clone https://github.com/karpathy/nanoGPT && python train.py config/train_shakespeare_char.py
GitHub ↗
The Annotated Transformer
★ 6.5k
jupyter מתקדם
מאמר Attention Is All You Need עם הקוד מוטמע משפט-משפט. הדרך הקלאסית להבין transformer לעומק.
git clone https://github.com/harvardnlp/annotated-transformer
GitHub ↗
llm.c — Karpathy
★ 27k
c מתקדם
GPT-2/3 מאפס ב-C/CUDA — ללא PyTorch. minimal, fast, educational.
git clone https://github.com/karpathy/llm.c && make train_gpt2
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
אינטגרציה של סוכנים AI במערכות Event-Sourced
Divakar Kumar מציג גישה להוספת שכבת סוכנים AI למערכות קיימות. הסוכנים עובדים על אירועים ומחליטים במקרים אמביגויים. הגישה משתמשת בארכיטקטורת event-sourced קיימת, ומוסיפה שכבה סמנטית וסוכנים המתקשרים באופן א-סינכרוני.
02YT AI Engineer · וידאו · מתקדם
AI על מאגר הנתונים: הקשר מגיע בצורות, לא בשאילתות
זאך בלומנפלד מציג את החשיבות של הקשר במודלי AI. הוא מראה כיצד חיפוש וקטורי ו-Text2SQL יכולים לספק תשובות שגויות. הוא מציג שלוש צורות גרפיות שיכולות לסייע למודלי AI להבין את הנתונים.
03YT AI Engineer · וידאו · מתקדם
מדוע הרגנו את הצינור הרב-סוכן שלנו
צוות ZS Associates בנה מערכת אנליטיקה רפואית שמחקה אנליסט אנושי. הם החליפו צינור רב-סוכן ב-Claude Code, והתוצאה הייתה מערכת קטנה ויעילה יותר. המערכת החדשה משתמשת בגרף ידע כמישור בקרה, ומסוגלת לבצע ב-20 דקות מה שאנליסט עושה בחודש.
04MIT Tech Review AI · כתבה · מתקדם
קידום AI דור חדש עם חדשנות במדע חומרים
התקדמות ב-AI דור חדש דורשת עלייה בביצועים, אנרגיה ואמינות. חומרים מתקדמים מאפשרים זאת. יצרני מעגלים מחפשים חומרים עם טוהר גבוה, עמידות כימית ויציבות.
05YT AI Engineer · וידאו · מתקדם
בניית סוכן AI GTM שיודע את הקונה
דר. סאג'ן קאנוקולאנו מסביר כיצד לבנות מערכת AI GTM שיודעת את הקונה. הוא מדבר על החשיבות של חיבור ה-AI לסטק ה-GTM, כולל CRM, נתוני כוונה, זהות מבקר ולוגיקת ניתוב. הוא גם משתף את הארכיטקטורה שפותחה עבור לקוח, שמאפשרת לסוכן AI לזהות קונים, לאישי את השיחה ולנתב אותם בזמן אמת.
06YT AI Engineer · וידאו · מתקדם
מהו שכבת ההקשר?
שכבת ההקשר היא התשתית החסרה לסוכנים מלאכותיים. פרוקלפה סנקר מסבירה כיצד לתת לסוכנים הבנה הקשרית. היא דנה בארכיטקטורה של שכבת ההקשר, כולל איך רפוזיטוריים של הקשר עובדים ואיך סימולציות תופסות כשלים לפני פריסה.
07MarkTechPost · כתבה · מתקדם
Robbyant משיק LingBot-VA 2.0: מודל וידאו-פעולה קוזאלי
Robbyant השיקה את LingBot-VA 2.0, מודל וידאו-פעולה קוזאלי לשליטה ברובוטים. המודל מאפשר שליטה טובה יותר בפעולות הרובוט ומבוסס על ארכיטקטורה חדשה.
08MarkTechPost · כתבה · מתקדם
נטפליקס מקצרת זמן המתנה לקריאה משניות למילישניות
נטפליקס פיתחה שיטה לטיפול במחיצות רחבות ב-Apache Cassandra. השיטה מיועדת ל- TimeSeries Abstraction, פלטפורמה לנתוני אירועים זמניים. החידוש מאפשר קריאה מהירה יותר.
02

טוקנייזר: BPE מאפס

מימוש Byte Pair Encoding משלך. הבנה איך טקסט הופך לטוקנים ולמה זה משנה.

~3 שעותמתקדם
שיעור

בעולם של מודלי שפה גדולים (LLMs), הטקסט שאנו קוראים אינו מוזן ישירות לרשת הנוירונים. במקום זאת, הוא עובר תהליך של טוקניזציה (Tokenization) – פירוק הטקסט ליחידות משמעותיות קטנות הנקראות טוקנים (Tokens). האלגוריתם הסטנדרטי והנפוץ ביותר כיום למשימה זו הוא Byte Pair Encoding (BPE). הבנת ה-BPE מאפס היא קריטית עבור מפתחי AI מתקדמים, שכן היא חושפת את "הקופסה השחורה" שבין הטקסט הגולמי לבין ה-Embeddings של המודל.

מדוע חשוב להבין ולממש BPE בעצמנו? רוב הבעיות המוזרות של מודלי שפה – כמו הקושי בהיפוך מילים, ספירת תווים או התמודדות עם שפות שאינן אנגלית – נובעות ישירות מהטוקנייזר. כאשר אנו מבינים כיצד הטוקנייזר מייצג טקסט כרצף של בייטים (Bytes) ואיך הוא ממזג אותם באופן איטרטיבי, אנו יכולים לתכנן מודלים יעילים יותר, לחסוך בעלויות הקשר (Context Window) ולמנוע באגים חמקמקים בזמן ייצור.

האלגוריתם עובד בצורה פשוטה אך גאונית: אנו מתחילים בייצוג הטקסט כרצף של בייטים בודדים (ערכים בין 0 ל-255). לאחר מכן, אנו סופרים את כל זוגות הבייטים הסמוכים הנפוצים ביותר בטקסט האימון שלנו, וממזגים את הזוג הנפוץ ביותר לטוקן חדש (למשל, מספר 256). אנו חוזרים על התהליך הזה שוב ושוב עד שאנו מגיעים לגודל המילון (Vocabulary Size) הרצוי.

הנה מימוש בסיסי בפייתון של שלב ספירת הזוגות ומיזוגם בתוך אלגוריתם BPE:

def get_stats(ids):
    counts = {}
    for pair in zip(ids, ids[1:]):
        counts[pair] = counts.get(pair, 0) + 1
    return counts

def merge(ids, pair, idx):
    newids = []
    i = 0
    while i < len(ids):
        if i < len(ids) - 1 and (ids[i], ids[i+1]) == pair:
            newids.append(idx)
            i += 2
        else:
            newids.append(ids[i])
            i += 1
    return newids

הבנה מעמיקה של טוקניזציה חיונית במיוחד כאשר עוסקים במערכות מורכבות הדורשות דיוק גבוה. לדוגמה, במחקר על אימות נוירו-סימבולי של פלטי LLM עבור דומיינים רגישי מידע, ייצוג הטוקנים משפיע ישירות על היכולת לאכוף חוקים לוגיים על הפלט. כמו כן, שינויים ועדכונים במנועי האינדוקס כמו llama-index-core 0.14.16 מדגישים את החשיבות של ניהול נכון של טקסט וטוקנים בשלבי ה-Parsing וה-Embedding של מסמכים.

הצעד הבא שלכם: כדי להבין את הנושא לעומק, מומלץ להתחיל עם הפרויקט minBPE של Karpathy. זהו מימוש מינימלי ונקי המאפשר לכם לבנות טוקנייזר משלכם (בדומה לזה של GPT-4) תוך פחות משעה. הורידו את הקוד, הריצו אותו על טקסט בעברית, וראו כיצד המילון נבנה ומייצג את השפה שלנו בצורה יעילה.

פרויקטי התחלה3 REPOS
minBPE — Karpathy
★ 9k
python מתקדם
מימוש BPE מינימלי, נקי וברור. ייצרו את ה-tokenizer של GPT/Claude משלכם תוך שעה.
git clone https://github.com/karpathy/minbpe && pip install -e .
GitHub ↗
tiktoken — OpenAI
★ 13k
rust בינוני
ה-tokenizer הרשמי של OpenAI. encode/decode מהיר ב-Rust + Python bindings.
pip install tiktoken
GitHub ↗
tokenizers — HuggingFace
★ 9k
rust בינוני
הספרייה הרשמית לטוקנייזרים. תומכת BPE, WordPiece, SentencePiece, Unigram.
pip install tokenizers
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
בניית מוצרים סביב יכולות
יכולות הן מאפיינים חדשים. יוג'נדרה מיראג'ה מ-FactSet מדבר על בניית מוצרים סביב יכולות. הוא מסביר כיצד ליצור רישום יכולות מינימלי, על החשיבות של בדיקות ואיך לנהל יכולות בקנה מידה גדול.
02YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
03YT Google DeepMind · וידאו · מתקדם
הבנת מחשבות ה-AI
חוקרים מנסים להבין את ה'מחשבות' של AI. הם חוקרים את המבנים הפנימיים של רשתות עצביות מלאכותיות, כדי ליצור AI בטוח ואמין. המחקר כולל טכניקות פרשנות ובדיקת בטיחות.
04Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
05MarkTechPost · כתבה · מתקדם
פיתוח צינור להבנת חשבוניות בעזרת lift-pdf
פיתוח צינור להבנת חשבוניות בעזרת lift-pdf. הצינור משתמש במסמכים PDF סינתטיים ובמודל להבנת מסמכים. הוא מסוגל לחלץ נתונים כגון זהות ספק, מספר הזמנה וסטטוס תשלום.
06MarkTechPost · כתבה · מתקדם
הפיכת PDFs של מחקר לJSON מובנה עם אימות שדה-רמה מבוקר
פותחים עבודת מחקר להפיכת PDFs לJSON מובנה. המערכת משתמשת ב-Lift כדי לחלץ נתונים ממסמכים, כולל כותרות, מחברים, מאגרי נתונים וקישורים.
07YT AI Engineer · וידאו · מתקדם
תורבוצ'רג' את זיכרון האג'נט עם TurboQuant
TurboQuant הוא שיטה לדחיסת וקטורים ל-3–4 ביטים, תוך שמירה על איכות. הוא פותח על ידי Google Research ויכול לשמש לשיפור זיכרון האג'נט.
08Vercel AI SDK · כתבה · מתקדם
@ai-sdk/מסע 2.0.0
שוחרר @ai-sdk/מסע 2.0.0 עם תמיכה ב-embedding ו-reranking. השינויים כוללים תמיכה בספקי AI ושיפורים ביישום.
03

training loop מינימלי

אימון מודל GPT קטן על Shakespeare/Tiny Stories. forward pass, backward pass, optimizer, scheduler.

~6 שעותמתקדם
שיעור

בעולם של מודלי שפה גדולים, קל ללכת לאיבוד מאחורי ספריות עיטוף (wrappers) ברמה גבוהה כמו Hugging Face. עם זאת, כדי להבין באמת כיצד מודל GPT לומד, עלינו לצלול אל ה-training loop (לולאת האימון) המינימלית. לולאה זו היא הלב הפועם של כל תהליך למידת מכונה: היא מזינה את המודל בנתונים, מעריכה את השגיאות שלו, ומעדכנת את הפרמטרים שלו בהתאם. הבנת המכניקה הזו ברמת ה-PyTorch הבסיסית חיונית לדיבאגינג, לאופטימיזציה של ביצועים ולפיתוח ארכיטקטורות מותאמות אישית.

לולאת אימון בסיסית מורכבת מארבעה שלבים מרכזיים החוזרים על עצמם בכל איטרציה (step). השלב הראשון הוא ה-forward pass, שבו אנו מזינים את ה-tokens של הטקסט (למשל, מתוך מאגר Shakespeare או Tiny Stories) אל תוך המודל ומקבלים את ה-logits (התחזיות). מתוך ה-logits הללו אנו מחשבים את ה-loss (לרוב Cross Entropy Loss) מול ה-targets (הטוקן הבא האמיתי). מיד לאחר מכן מגיע ה-backward pass: באמצעות הקריאה ל-loss.backward(), מנוע ה-Autograd של PyTorch מחשב את הנגזרות החלקיות (הגרדיאנטים) של ה-loss ביחס לכל אחד מהפרמטרים הניתנים לאימון במודל.

לאחר חישוב הגרדיאנטים, נכנס לתמונה ה-optimizer (כמו AdamW). תפקידו לעדכן את משקולות המודל בכיוון שמפחית את ה-loss, באמצעות הפעלת optimizer.step(). לפני המעבר לאיטרציה הבאה, חובה לאפס את הגרדיאנטים בעזרת optimizer.zero_grad(set_to_none=True) כדי למנוע הצטברות לא רצויה שלהם. כדי לשפר את היציבות ואת מהירות ההתכנסות, נהוג לשלב learning rate scheduler (כמו Cosine Decay). ה-scheduler משנה את קצב הלמידה לאורך זמן: הוא מתחיל נמוך (warmup), מגיע לשיא, ואז דועך בהדרגה ככל שהאימון מתקדם.

הנה דוגמה קלאסית ומינימלית ללולאת אימון ב-PyTorch:

import torch

model.train()
optimizer = torch.optim.AdamW(model.parameters(), lr=6e-4)
scheduler = torch.optim.lr_scheduler.CosineAnnealingLR(optimizer, T_max=1000)

for step in range(max_steps):
    inputs, targets = get_batch()  # שליפת batch מתוך Shakespeare
    
    logits, loss = model(inputs, targets)  # Forward pass
    loss.backward()  # Backward pass
    
    torch.nn.utils.clip_grad_norm_(model.parameters(), max_norm=1.0)
    optimizer.step()  # Update weights
    scheduler.step()  # Update learning rate
    optimizer.zero_grad(set_to_none=True)  # Reset gradients

כדי לראות כיצד הקוד המינימלי הזה מתרחב למערכות פרודקשן אמיתיות, מומלץ לחקור את פרויקט nanoGPT של Andrej Karpathy. בקובץ train.py שלו תוכלו לראות בדיוק כיצד הלולאה הזו נבנית מאפס, כולל תמיכה ב-mixed precision (FP16/BF16) וחלוקה ל-validation. מקור מצוין נוסף להבנת הארכיטקטורה מקצה לקצה הוא הספר Build a LLM from Scratch מאת Sebastian Raschka, שמסביר צעד אחר צעד כיצד לחבר את חלקי הפאזל של ה-tokenizer, המודל ולולאת האימון.

הצעד הבא שלכם: הורידו את ה-repository של nanoGPT, הריצו את סקריפט הכנת הנתונים על קובץ ה-Shakespeare המינימלי (data/shakespeare_char/prepare.py), והפעילו את ה-training loop המקומית בעזרת train.py. עקבו אחר ירידת ה-loss בזמן אמת ונסו לשנות את ה-learning rate כדי לראות כיצד זה משפיע על קצב ההתכנסות של המודל.

פרויקטי התחלה3 REPOS
nanoGPT — training
★ 41k
python מתקדם
אותו repo כמו לעיל, אבל הפעם מתמקדים ב-train.py: data loader, optimizer, scheduler, checkpointing.
python train.py config/train_gpt2.py
GitHub ↗
TinyLlama
★ 8.5k
python מתקדם
אימון Llama 1.1B מאפס על 3 טריליון tokens. סקריפטים מלאים, פיצול multi-GPU, monitoring.
git clone https://github.com/jzhang38/TinyLlama && pip install -r requirements.txt
GitHub ↗
Sebastian Raschka — Build a LLM from Scratch
★ 50k
jupyter מתקדם
הספר המלא + קוד. כל פרק נבנה עליו את הקודם — מ-tokenizer ועד fine-tuning + DPO.
git clone https://github.com/rasbt/LLMs-from-scratch
GitHub ↗
חומרי קריאה8 פריטים
01Pydantic AI · כתבה · מתקדם
pydantic-ai v2.21.0
שוחררה גרסה v2.21.0 של pydantic-ai. הגרסה החדשה כוללת תכונות חדשות ותיקוני באגים, כולל הוספת per_request_input_tokens_limit ל-UsageLimits ורענון KnownModelName מ-Gateway probes ו-Google image IDs.
02YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
03YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
04YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
05YT AI Engineer · וידאו · מתקדם
ALPHALAB של Morgan Stanley: מחקר רב-סוכנים
ALPHALAB הוא מערכת רב-סוכנים שפיתחה Morgan Stanley. המערכת מקבלת בעיה בשפה טבעית, כותבת קוד, מבצעת בדיקות ואופטימיזציה. היא כוללת סוכנים אסטרטגיים וסוכנים עובדים, ומאפשרת עריכה ואישור לפני ביצוע.
06YT AI Engineer · וידאו · מתקדם
סוכנים לקבוצות, לא רק למשתמש יחיד
סוכנים מותאמים לקבוצות, ולא רק למשתמשים יחידים, דורשים פתרונות חדשים לבעיות אבטחה וזיכרון. סאי קרישנה ראלאבאנדי מציג פתרון להגנה על סוכנים בקבוצות, עם מודל קטן ואדפטרים למשתמשים.
07YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
08Pydantic AI · כתבה · מתקדם
עדכון pydantic-ai v2.19.0
עדכון pydantic-ai v2.19.0 כולל תיקוני באגים ושיפורים. נוספו headers ו-retry_after ל-ModelHTTPError. העדכון כולל גם עדכון תלות FastMCP.
04

Fine-tuning עם LoRA

מ-base model ל-assistant: SFT עם Llama/Qwen קטנים. unsloth + datasets קצרים.

~5 שעותמתקדם
שיעור

תהליך ה-Fine-tuning (כיוונון עדין) הוא השלב הקריטי שבו אנו לוקחים מודל בסיס (Base Model) כמו Llama 3 או Qwen, אשר אומן רק לנחש את המילה הבאה, והופכים אותו לעוזר אישי (Assistant) המסוגל לענות לשאלות, לעקוב אחר הוראות ולשמור על פורמט שיחה קבוע. תהליך זה נקרא Supervised Fine-Tuning (SFT), והוא מאפשר לנו להטמיע במודל סגנון דיבור ספציפי, ידע ייחודי או יכולת עבודה מדויקת עם ממשקים חיצוניים.\n\nבעבר, כיוונון מלא של מודלי שפה דרש משאבי מחשוב עצומים וכרטיסי מסך (GPUs) יקרים במיוחד. טכנולוגיית LoRA (Low-Rank Adaptation) פותרת את הבעיה הזו על ידי הקפאת משקלי המודל המקוריים והוספת מטריצות קטנות ורזות (Low-Rank) לשכבות ה-Attention. במהלך האימון אנו מעדכנים רק את המטריצות הללו, מה שמפחית את מספר הפרמטרים המאומנים בלמעלה מ-99%, חוסך זיכרון וידאו (VRAM) ומאפשר להריץ אימונים מלאים על חומרה נגישה.\n\nכדי להתחיל לעבוד בצורה המהירה ביותר, מומלץ להשתמש בספריית unsloth. היא מציעה האצה של פי 2 במהירות האימון וחיסכון של כ-70% בזיכרון ה-GPU בזכות קרנלים מותאמים אישית ב-Triton. עבור פרויקטים מורכבים יותר הדורשים אימון מבוזר על מספר כרטיסי מסך, ספריות כמו axolotl או TRL של HuggingFace יספקו את הגמישות והכלים הדרושים לניהול פייפליין האימון.\n\nהנה דוגמה קצרצרה לאימוץ מודל Llama 3 בעזרת Unsloth:\n\n``python\nfrom unsloth import FastLanguageModel\nimport torch\n\n# 1. טעינת המודל והטוקנייזר עם תמיכת LoRA מובנית\nmodel, tokenizer = FastLanguageModel.from_pretrained(\n model_name="unsloth/llama-3-8b-Instruct-bnb-4bit",\n max_seq_length=2048,\n load_in_4bit=True,\n)\n\n# 2. הגדרת פרמטרי LoRA\nmodel = FastLanguageModel.get_peft_model(\n model, \n r=16, \n target_modules=["q_proj", "k_proj", "v_proj", "o_proj"],\n lora_alpha=16,\n lora_dropout=0,\n bias="none"\n)\n``\n\nאימון מוצלח אינו דורש מיליוני דוגמאות; לעיתים קרובות, דאטהסט איכותי וממוקד של כ-1,000 דוגמאות שיחה יספיק כדי לשנות לחלוטין את התנהגות המודל. כיוונון כזה קריטי במיוחד כאשר רוצים שהמודל יתממשק בצורה אמינה עם ספריות קוד מתקדמות, למשל לצורך הפקת פלטים מובנים ב-pydantic-ai v1.98.0 או לשילובו כסוכן חכם בתוך ארכיטקטורת סוכנים מרובים כמו LangGraph 1.2.1.\n\nהצעד הבא שלכם: פתחו את אחד ממחברות ה-Colab המוכנות של unsloth, טענו דאטהסט קטן בפורמט Alpaca (למשל, הוראות ומענים של שירות לקוחות או פורמט JSON ספציפי), והריצו אימון LoRA ראשון. בתוך פחות מ-20 דקות יהיה לכם מודל מותאם אישית שתוכלו להעלות ישירות ל-HuggingFace Hub.

פרויקטי התחלה3 REPOS
unsloth
★ 22k
python מתקדם
Fine-tuning של Llama/Qwen/Mistral מהיר פי 2 וב-70% פחות זיכרון. Colab notebooks מוכנים.
pip install unsloth
GitHub ↗
axolotl
★ 8k
python מתקדם
YAML-based fine-tuning. תומך כל המודלים הפופולריים, multi-GPU, distributed, deepspeed.
pip install axolotl
GitHub ↗
TRL — Transformer RL
★ 14k
python מתקדם
הספרייה הרשמית של HuggingFace ל-SFT/DPO/PPO/GRPO. דוגמאות לכל פייפליין.
pip install trl
GitHub ↗
חומרי קריאה8 פריטים
01Pydantic AI · כתבה · מתקדם
pydantic-ai v2.21.0
שוחררה גרסה v2.21.0 של pydantic-ai. הגרסה החדשה כוללת תכונות חדשות ותיקוני באגים, כולל הוספת per_request_input_tokens_limit ל-UsageLimits ורענון KnownModelName מ-Gateway probes ו-Google image IDs.
02YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
03YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
04YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
05YT AI Engineer · וידאו · מתקדם
ALPHALAB של Morgan Stanley: מחקר רב-סוכנים
ALPHALAB הוא מערכת רב-סוכנים שפיתחה Morgan Stanley. המערכת מקבלת בעיה בשפה טבעית, כותבת קוד, מבצעת בדיקות ואופטימיזציה. היא כוללת סוכנים אסטרטגיים וסוכנים עובדים, ומאפשרת עריכה ואישור לפני ביצוע.
06YT AI Engineer · וידאו · מתקדם
סוכנים לקבוצות, לא רק למשתמש יחיד
סוכנים מותאמים לקבוצות, ולא רק למשתמשים יחידים, דורשים פתרונות חדשים לבעיות אבטחה וזיכרון. סאי קרישנה ראלאבאנדי מציג פתרון להגנה על סוכנים בקבוצות, עם מודל קטן ואדפטרים למשתמשים.
07YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
08Pydantic AI · כתבה · מתקדם
עדכון pydantic-ai v2.19.0
עדכון pydantic-ai v2.19.0 כולל תיקוני באגים ושיפורים. נוספו headers ו-retry_after ל-ModelHTTPError. העדכון כולל גם עדכון תלות FastMCP.
05

post-training: RLHF / DPO

איך מודל בסיס הופך ל-chat assistant. השוואת RLHF (PPO) מול DPO. TRL ב-Python.

~6 שעותמתקדם
שיעור

מודלי בסיס (Base Models) מצטיינים בניבוי הטוקן הבא על גבי קורפוס עצום של טקסט, אך הם אינם מותאמים מטבעם לשיחה אינטראקטיבית עם בני אדם. כדי להפוך מודל גולמי לעוזר אישי (Chat Assistant) מועיל, בטוח ומנומס, אנו נדרשים לשלב ה-Post-training. שלב זה מתמקד בהתאמת התנהגות המודל להעדפות אנושיות (Alignment), ומבוצע לרוב באמצעות שיטות של למידת חיזוק (Reinforcement Learning) או אופטימיזציה ישירה של העדפות.

השיטה הקלאסית, RLHF (שמבוססת לרוב על אלגוריתם PPO), דורשת אימון של מודל תגמול (Reward Model) נפרד שמדרג את תשובות המודל, ולאחר מכן הרצת לולאת RL מורכבת לעדכון המודל היוצר (Actor). תהליך זה נוטה לחוסר יציבות וצורך משאבי חישוב אדירים. לעומתה, שיטת DPO (Direct Preference Optimization) חוללה מהפכה בכך שהיא מייתרת את מודל התגמול ואת לולאת ה-RL. DPO מגדירה פונקציית הפסד (Loss) ישירה על זוגות של העדפות (תשובה מועדפת מול תשובה דחויה), ומאפשרת אופטימיזציה יציבה ומהירה בהרבה, הדומה לאימון מפוקח (SFT) רגיל.

עם זאת, הבחירה בין השתיים אינה חד-משמעית. בעוד ש-DPO מצוינת למשימות סגנון והעדפה כללית, מחקרים מראים כי במשימות חשיבה מורכבות ודיאלוגים רב-סבביים, למידת חיזוק אינטראקטיבית עדיין מחזיקה ביתרון משמעותי. לדוגמה, במאמר מאימון סטטי ל-RL אינטראקטיבי מכויל: הפחתת היסט התפלגות בדיאלוג רב-סבבים מוסבר כיצד RL אינטראקטיבי מפחית את היסט ההתפלגות (Distribution Shift) בשיחות ארוכות. כמו כן, מחקרים כמו עומק חשיבה ומורכבות סביבה מראים כיצד שילוב של סביבות למידה מבוססות כללים (RLVR) חיוני לפיתוח יכולות חשיבה לוגית מתקדמות במודלים.

כדי ליישם שיטות אלו בפועל, ספריית TRL (Transformer Reinforcement Learning) מבית Hugging Face מציעה פתרון אינטגרטיבי ונוח. הספרייה מספקת מחלקות ייעודיות כמו DPOTrainer ו-PPOTrainer המאפשרות לבצע את תהליך ה-Alignment בכמה שורות קוד בודדות, תוך תמיכה בטכניקות יעילות זיכרון כמו LoRA ו-DeepSpeed.

להלן דוגמה בסיסית להגדרת אימון DPO באמצעות TRL ב-Python:

from transformers import AutoModelForCausalLM, AutoTokenizer
from trl import DPOTrainer, DPOConfig
from datasets import load_dataset

model = AutoModelForCausalLM.from_pretrained("gpt2")
ref_model = AutoModelForCausalLM.from_pretrained("gpt2")
tokenizer = AutoTokenizer.from_pretrained("gpt2")
tokenizer.pad_token = tokenizer.eos_token
dataset = load_dataset("Anthropic/hh-rlhf", split="train[:100]")

training_args = DPOConfig(output_dir="./dpo_results", beta=0.1, max_length=512)
trainer = DPOTrainer(model, ref_model, args=training_args, train_dataset=dataset, tokenizer=tokenizer)
trainer.train()

הצעד הבא שלכם: כדי להתחיל להתנסות, מומלץ לשכפל את מאגר הקוד של TRL ולהריץ את סקריפט ה-DPO המובנה (examples/scripts/dpo.py) על גבי דאטהסט קטן כמו Anthropic/hh-rlhf. אם אתם מכוונים לאימון מודלים ענקיים על גבי מספר כרטיסי מסך, כדאי לבחון את OpenRLHF המציע תשתית מבוזרת ויציבה המשלבת את Ray ו-DeepSpeed.

פרויקטי התחלה3 REPOS
TRL — DPO/PPO examples
★ 14k
python מתקדם
examples/scripts כולל dpo.py ו-ppo.py מוכנים להרצה.
pip install trl && cd trl/examples
GitHub ↗
OpenRLHF
★ 6.5k
python מתקדם
פריימוורק RLHF גמיש ויעיל. תומך PPO, DPO, GRPO על מספר GPU עם Ray + DeepSpeed.
pip install openrlhf
GitHub ↗
verl
★ 8k
python מתקדם
הפריימוורק החדש של ByteDance ל-RL post-training. מסוגל GRPO על LLMs ענקיים.
git clone https://github.com/volcengine/verl
GitHub ↗
חומרי קריאה8 פריטים
01CrewAI releases · כתבה · מתקדם
עדכון 1.15.7a1: תיקוני באגים ושיפורים
עדכון 1.15.7a1 ל-CrewAI מתקן באגים ומשפר את קריאת הכלים. העדכון כולל תיקונים ל-GPT-5.6 ושיפורים בנוגע ל-Responses API.
02YT AI Engineer · וידאו · מתקדם
מעבר מעקבות אג'נטים לסימולציות אג'נטים
רוסטם פייזחאנוב מ-Snorkel AI מציג גישה לבניית סימולציות אג'נטים מעקבות ייצור. המטרה היא ליצור סביבת בדיקות פרטית המדמה את התנאים המציאותיים, ולאפשר השוואה בין מודלים שונים. הסימולציה כוללת כלים, מערכות ומדרגים, ומאפשרת לבדוק את ביצועי האג'נטים בתנאים מבוקרים.
03YT AI Engineer · וידאו · מתקדם
זמן ריצה פעיל של Active Graph Agent
Yohei Nakajima מציג את ActiveGraph, ריצה פעילה של סוכן גרף. המערכת בונה סביב לוג אימותי ומאפשרת שיפור עצמי. היא משתמשת בארכיטקטורת לוחות צ'רנוקי ו-Kafka.
04YT AI Engineer · וידאו · מתקדם
Prime Intellect Stack
Prime Intellect מציגה אקוסיסטם קוד פתוח לכלים אחרי אימון, כולל ספריות וריפייררים. הרצאה על ידי Will Brown, ראש מחקר שימושי ב-Prime Intellect.
05MarkTechPost · כתבה · מתקדם
TRACE: מערכת אימון אגנטים באמצעות סביבות סינתטיות
חוקרים מסטנפורד הציגו את TRACE, מערכת לאימון אגנטים באמצעות סביבות סינתטיות. המערכת מזהה חוסרים ביכולות האגנט ומאמנת אותו באופן יעיל. TRACE פותרת בעיה של אגנטים שנכשלים באופן חוזר, על ידי יצירת סביבות סינתטיות המתאימות לכל חוסר.
06MarkTechPost · כתבה · מתקדם
Prime Intellect משחרר Verifiers v1
Prime Intellect השיקה Verifiers v1, כלי לאימון והערכה של למידת חיזוק עם סוכנים. Verifiers v1 מאפשר ריצה של סוכנים עם כלים ותשתיות שונות, ומספק יכולת להרצת ניסויים בקנה מידה גדול.
07Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
08YT AI Engineer · וידאו · מתקדם
אותות משתמש נפסקים בגבול האחזור
שיטה חדשה ללמידת סוכנים: אחסון זיכרונות בהתאם לתועלתם. הרצאה על ידי Sonam Pankaj, מייסדת StarlightSearch. היא מציגה פתרון לבעיה של סוכנים שאינם זוכרים את הצלחות וכישלונות העבר.
06

Inference יעיל — KV cache, sampling, quantization

אופטימיזציות שמשנות סדרי גודל בביצועים: KV cache, beam vs greedy vs nucleus, INT8/4 quantization.

~4 שעותמתקדם
שיעור

הרצת מודלי שפה גדולים (LLMs) בסביבת פרודקשן מציבה אתגרים עצומים של זיכרון ורוחב פס (Memory Bandwidth). בניגוד לשלב האימון (Training) שבו החישובים מתבצעים במקביל, שלב ה-Inference הוא אוטורגרסיבי (Auto-regressive) – המודל מייצר טוקן אחר טוקן, כאשר כל טוקן חדש דורש חישוב מחדש של כל ההקשר שקדם לו. כדי למנוע צווארי בקבוק אלו ולשפר את ה-Throughput ואת ה-Latency בסדרי גודל, אנו משתמשים בשלוש טכניקות אופטימיזציה מרכזיות: KV cache, Sampling מתקדם ו-Quantization (קוונטיזציה).

הטכניקה הבסיסית והחשובה ביותר היא KV cache (Key-Value cache). בכל צעד של יצירת טוקן, מנגנון ה-Attention צריך לחשב את ה-Keys וה-Values עבור כל הטוקנים הקודמים. במקום לחשב אותם מחדש בכל טוקן חדש (מה שיוצר סיבוכיות של $O(N^2)$ בזמן החישוב), אנו שומרים את ה-Keys וה-Values של הטוקנים הקודמים בזיכרון ה-GPU. פרויקטים מתקדמים כמו vLLM לקחו את זה צעד קדימה עם PagedAttention, המנהל את זיכרון ה-KV cache בדומה לניהול זיכרון וירטואלי במערכות הפעלה, ובכך מונע פרגמנטציה ומאפשר Batching דינמי ויעיל במיוחד.

כדי להתמודד עם מגבלת הזיכרון הפיזי (VRAM), אנו משתמשים ב-Quantization (דחיסת משקולות). מודלים מיוצגים במקור בפורמט FP16 או BF16 (שני בייטים לפרמטר). קוונטיזציה ל-INT8 או INT4 מאפשרת לדחוס את משקולות המודל פי 2 עד 4, כמעט ללא פגיעה בדיוק המודל. כלי כמו llama.cpp מאפשר להריץ מודלים ענקיים על חומרת קצה (כמו מעבדי Apple Silicon או אפילו CPU פשוט) בזכות מימוש יעיל במיוחד של קוונטיזציות מסוג GGUF.

היבט נוסף המשפיע על יעילות ואיכות ה-Inference הוא אסטרטגיית ה-Sampling. בעוד ש-Greedy Search בוחר תמיד את הטוקן בעל ההסתברות הגבוהה ביותר (מה שעלול להוביל ללולאות חזרתיות), ו-Beam Search שומר מספר מסלולים במקביל (יקר חישובית), שיטות מודרניות כמו Nucleus Sampling (Top-p) ו-Top-k מספקות את האיזון המושלם. הן מסננות את מרחב הטוקנים האפשריים בזמן אמת, ובכך חוסכות משאבי חישוב ומייצרות טקסט טבעי ומגוון יותר.

הנה דוגמה פשוטה לשימוש ב-vLLM להרצת Inference מהיר במיוחד עם הגדרות Sampling מתקדמות:

from vllm import LLM, SamplingParams

# אתחול המודל עם תמיכה מובנית ב-PagedAttention ו-KV cache אופטימלי
llm = LLM(model="facebook/opt-125m")

# הגדרת פרמטרי Sampling ליצירת טקסט איכותי ויעיל
sampling_params = SamplingParams(
    temperature=0.7,
    top_p=0.9,
    max_tokens=100
)

prompts = ["The future of AI inference is"]
outputs = llm.generate(prompts, sampling_params)

for output in outputs:
    print(f"Generated text: {output.outputs[0].text}")

הבנת האופטימיזציות האלו קריטית כאשר בונים מערכות AI מקומיות או מבוזרות. לדוגמה, בפודקאסט יצירת עוזר AI פרטי ב-Thunderbird נידונה החשיבות של הרצת מודלים מקומיים ביעילות על חומרת קצה מוגבלת. כמו כן, הדינמיקה בין מודלים פתוחים לסגורים, כפי שמתואר בפרק האגדה על מלחמות המודלים: פתוח vs סגור ב-2026, מושפעת ישירות מהיכולת של הקהילה להריץ מודלים פתוחים ביעילות מקומית באמצעות טכנולוגיות כמו llama.cpp ו-vLLM.

הצעד הבא שלך: כדי לחוות את עוצמת האופטימיזציה בעצמך, התקן את llama.cpp על המחשב האישי שלך. הורד מודל בפורמט GGUF (למשל Llama 3 בקוונטיזציה של Q4_K_M) והרד אותו דרך הטרמינל. שים לב להבדל במהירות ה-Inference (טוקנים לשנייה) בהשוואה להרצה של מודל לא מכווץ, וראה כיצד ה-KV cache המובנה שומר על ביצועים יציבים גם ככל שהצ'אט מתארך.

פרויקטי התחלה3 REPOS
vLLM
★ 35k
python מתקדם
ה-inference engine המוביל. PagedAttention, continuous batching, throughput x10 מ-HF transformers.
pip install vllm && vllm serve meta-llama/Llama-3.3-70B-Instruct
GitHub ↗
gpt-fast — PyTorch
★ 6k
python מתקדם
PyTorch native, ~1000 שורות, ביצועים תחרותיים. נקודת התחלה ללמוד KV cache + sampling.
git clone https://github.com/pytorch-labs/gpt-fast
GitHub ↗
llama.cpp
★ 70k
cpp מתקדם
C++ נטו, רץ על CPU/Metal/CUDA. quantization, KV cache, embed everywhere.
git clone https://github.com/ggerganov/llama.cpp && make
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
02YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
03Vercel AI SDK · כתבה · בינוני
@ai-sdk/workflow עדכון
חברת Vercel עדכנה את ה-SDK שלה. העדכון כולל עדכונים לתלויות ושיפורים אחרים.
04YT AI Engineer · וידאו · מתקדם
אינטגרציה של סוכנים AI במערכות Event-Sourced
Divakar Kumar מציג גישה להוספת שכבת סוכנים AI למערכות קיימות. הסוכנים עובדים על אירועים ומחליטים במקרים אמביגויים. הגישה משתמשת בארכיטקטורת event-sourced קיימת, ומוסיפה שכבה סמנטית וסוכנים המתקשרים באופן א-סינכרוני.
05YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
06YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
07Vercel AI SDK · כתבה · בינוני
עדכון @ai-sdk/workflow-harness@1.0.45
חברת Vercel הוציאה עדכון לחבילת @ai-sdk/workflow-harness. העדכון כולל שיפורים באפשרויות generateObject ו-streamObject, וכן עדכונים לתלויות החבילה.
08YT AI Engineer · וידאו · מתקדם
סוכנים מלאכותיים לביצועים: משלוח מהיר, תשלום פחות
צוותו של ראג'אט שאה בנטפליקס בנה סוכן לטיפול בבעיות ביצועים. הסוכן מזהה בעיות, מציע פתרונות ומאשר אותם. הדבר מאפשר משלוח מהיר יותר ותשלום פחות.