יום חמישי, 30 ביולי 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים Open Source LLM
מסלול לימוד

Open Source LLM

Llama / Qwen / DeepSeek — fine-tuning, local inference, leaderboards, GGUF, vLLM.

20 שעות
17 צמתים
בינוני
01

ארכיטקטורה: מה בפנים של Llama/Qwen

איך מודלים מודרניים בנויים — RoPE, GQA, SwiGLU, RMSNorm. ההבדלים בין משפחות.

~3 שעותמתקדם
שיעור

מודלי שפה מודרניים כמו Llama 3 ו-Qwen 2.5 נראים ממבט ראשון כמו ה-Transformer המקורי מ-2017, אך מתחת למכסה המנוע הם עברו אבולוציה ארכיטקטונית דרמטית. במקום הארכיטקטורה הסטנדרטית של GPT-2, מודלים מודרניים אלו מתבססים על שילוב של ארבעה רכיבי מפתח: RMSNorm לייצוב הצימוד, SwiGLU כפונקציית אקטיבציה מתקדמת ב-FFN, RoPE לייצוג מיקום סיבובי, ו-GQA (Grouped-Query Attention) המאפשר יעילות חישובית יוצאת דופן בזמן הסקה (Inference). הבנת הרכיבים הללו היא קריטית לכל מי שמפתח, מאמן או מבצע אופטימיזציה למודלי קצה.

נתחיל בשיפורי היציבות והחישוב: RMSNorm (Root Mean Square Normalization) מחליף את ה-LayerNorm המסורתי על ידי ויתור על חישוב הממוצע (mean centering), מה שמקצר את זמן החישוב ב-10%-50% מבלי לפגוע בביצועים. בגזרת האקטיבציה, SwiGLU מחליפה את ה-GELU הסטנדרטית; היא משלבת את פונקציית Swish עם מנגנון Gated Linear Unit, מה שמאפשר למודל ללמוד ייצוגים מורכבים יותר אך דורש הגדלה קלה של מספר הפרמטרים בשכבת ה-Feed-Forward.

השינוי המשמעותי ביותר בביצועי ההקשר (Context Window) מגיע מ-RoPE (Rotary Position Embedding) ו-GQA. RoPE מייצג מיקום יחסי על ידי סיבוב וקטורי ה-Query וה-Key במרחב הדו-ממדי, מה שמאפשר אקסטרפולציה חלקה לאורכי הקשר עצומים (כמו 128K ב-Llama 3). במקביל, GQA פותר את צוואר הבקבוק של ה-KV Cache על ידי חלוקת ה-Keys וה-Values לקבוצות (Groups), כך שמספר ראשי ה-Query גדול ממספר ראשי ה-KV. זה מקטין דרמטית את דרישות הזיכרון בזמן Inference ומאפשר Batch Size גדול בהרבה.

כדי להבין איך הרכיבים הללו מתחברים יחד, מומלץ להסתכל על מימוש נקי של השכבות הללו. ספריית x-transformers של lucidrains מאפשרת להגדיר מודלים מותאמים אישית עם הרכיבים הללו בשורות קוד בודדות. הנה דוגמה קצרה להגדרת Transformer מודרני המשתמש ב-RMSNorm, SwiGLU ו-RoPE:

from x_transformers import TransformerWrapper, Decoder

# הגדרת מודל דמוי Llama עם ארכיטקטורה מודרנית
model = TransformerWrapper(
    num_tokens = 20000,
    max_seq_len = 1024,
    attn_layers = Decoder(
        dim = 512,
        depth = 6,
        heads = 8,
        attn_flash = True,           # שימוש ב-Flash Attention ליעילות
        rotary_pos_emb = True,       # RoPE (Rotary Position Embedding)
        ff_glu = True,               # SwiGLU Activation
        rms_norm = True              # RMSNorm במקום LayerNorm
    )
)

להעמקה נוספת בארכיטקטורות הללו והשפעתן על התנהגות המודל, אנו ממליצים לקרוא את המחקר על בחירה אוטומטית של שכבות לזיהוי הזיות במודלי שפה, המציג כיצד שכבות שונות בארכיטקטורות אלו מקודדות מידע סמנטי ואיפה נוצרות הזיות. בנוסף, כדאי לבחון את הדיון על ניהול זיכרון ארוך טווח במאמר האם זיכרון של סוכנים הוא מסד נתונים? כדי להבין כיצד חלון ההקשר המורחב משפיע על ארכיטקטורת סוכנים (Agents).

הצעד הבא שלכם: הורידו ושבטו את ה-Repository הרשמי של Llama 3 Implementation. עברו על קובץ model.py והתמקדו במימוש של פונקציית precompute_freqs_cis (המשמשת עבור RoPE) ובמחלקה Attention המממשת את ה-GQA. הריצו את ה-minimal generation script שלהם כדי לראות את הקוד פועל מקצה לקצה.

פרויקטי התחלה2 REPOS
x-transformers
★ 5.5k
python מתקדם
ספריית transformers ניסיונית. כל וריאנט מהמחקר (Llama/GPT/T5/Reformer) במחלקה אחת בהירה.
pip install x-transformers
GitHub ↗
Llama 3 Implementation
★ 28k
python מתקדם
הקוד הרשמי של Meta ל-Llama 3. mini-implementation מצוין להבנת RoPE, GQA, SwiGLU בפרודקשן.
git clone https://github.com/meta-llama/llama3
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
אינטגרציה של סוכנים AI במערכות Event-Sourced
Divakar Kumar מציג גישה להוספת שכבת סוכנים AI למערכות קיימות. הסוכנים עובדים על אירועים ומחליטים במקרים אמביגויים. הגישה משתמשת בארכיטקטורת event-sourced קיימת, ומוסיפה שכבה סמנטית וסוכנים המתקשרים באופן א-סינכרוני.
02YT AI Engineer · וידאו · מתקדם
AI על מאגר הנתונים: הקשר מגיע בצורות, לא בשאילתות
זאך בלומנפלד מציג את החשיבות של הקשר במודלי AI. הוא מראה כיצד חיפוש וקטורי ו-Text2SQL יכולים לספק תשובות שגויות. הוא מציג שלוש צורות גרפיות שיכולות לסייע למודלי AI להבין את הנתונים.
03YT AI Engineer · וידאו · מתקדם
מדוע הרגנו את הצינור הרב-סוכן שלנו
צוות ZS Associates בנה מערכת אנליטיקה רפואית שמחקה אנליסט אנושי. הם החליפו צינור רב-סוכן ב-Claude Code, והתוצאה הייתה מערכת קטנה ויעילה יותר. המערכת החדשה משתמשת בגרף ידע כמישור בקרה, ומסוגלת לבצע ב-20 דקות מה שאנליסט עושה בחודש.
04MIT Tech Review AI · כתבה · מתקדם
קידום AI דור חדש עם חדשנות במדע חומרים
התקדמות ב-AI דור חדש דורשת עלייה בביצועים, אנרגיה ואמינות. חומרים מתקדמים מאפשרים זאת. יצרני מעגלים מחפשים חומרים עם טוהר גבוה, עמידות כימית ויציבות.
05YT AI Engineer · וידאו · מתקדם
בניית סוכן AI GTM שיודע את הקונה
דר. סאג'ן קאנוקולאנו מסביר כיצד לבנות מערכת AI GTM שיודעת את הקונה. הוא מדבר על החשיבות של חיבור ה-AI לסטק ה-GTM, כולל CRM, נתוני כוונה, זהות מבקר ולוגיקת ניתוב. הוא גם משתף את הארכיטקטורה שפותחה עבור לקוח, שמאפשרת לסוכן AI לזהות קונים, לאישי את השיחה ולנתב אותם בזמן אמת.
06YT AI Engineer · וידאו · מתקדם
מהו שכבת ההקשר?
שכבת ההקשר היא התשתית החסרה לסוכנים מלאכותיים. פרוקלפה סנקר מסבירה כיצד לתת לסוכנים הבנה הקשרית. היא דנה בארכיטקטורה של שכבת ההקשר, כולל איך רפוזיטוריים של הקשר עובדים ואיך סימולציות תופסות כשלים לפני פריסה.
07MarkTechPost · כתבה · מתקדם
Robbyant משיק LingBot-VA 2.0: מודל וידאו-פעולה קוזאלי
Robbyant השיקה את LingBot-VA 2.0, מודל וידאו-פעולה קוזאלי לשליטה ברובוטים. המודל מאפשר שליטה טובה יותר בפעולות הרובוט ומבוסס על ארכיטקטורה חדשה.
08MarkTechPost · כתבה · מתקדם
נטפליקס מקצרת זמן המתנה לקריאה משניות למילישניות
נטפליקס פיתחה שיטה לטיפול במחיצות רחבות ב-Apache Cassandra. השיטה מיועדת ל- TimeSeries Abstraction, פלטפורמה לנתוני אירועים זמניים. החידוש מאפשר קריאה מהירה יותר.
02

משפחת Llama

Llama 3.x — מתחילים, גדלים שונים, instruction-tuned.

~3 שעותבינוני
שיעור

משפחת מודלי Llama מבית Meta חוללה מהפכה בעולם ה-AI בקוד פתוח, כאשר סדרת Llama 3.x מייצגת את חזית הטכנולוגיה הנוכחית עבור מפתחים וחוקרים. מודלים אלו אומנו על כמויות עצומות של נתונים (טריליוני tokens) ומציעים ביצועים המתחרים במודלים מסחריים סגורים. הסדרה כוללת מודלים בגדלים שונים (כמו 8B, 70B ו-405B) המותאמים לצרכים שונים – החל מהרצה מקומית על מחשב נייד ועד לפריסות ענן מסיביות, כאשר גרסאות ה-Instruction-tuned עברו כוונון עדין מיוחד כדי להבין ולבצע הוראות מורכבות של משתמשים בצורה טבעית ומדויקת.

השימוש ב-Llama 3.x מומלץ במיוחד כאשר יש צורך בפרטיות מידע מלאה, שליטה בעלויות ה-Inference, או התאמה אישית (Fine-tuning) של המודל למשימות ספציפיות. בניגוד לשימוש ב-APIs סגורים של חברות כמו OpenAI או Anthropic, הרצת Llama 3.x מקומית או על שרת פרטי מבטיחה שהנתונים הרגישים שלכם לעולם לא יעזבו את הארגון. בנוסף, הגרסאות הקטנות יותר (כמו Llama 3 8B) מציעות יחס עלות-תועלת מעולה, ומאפשרות לבנות יישומי סוכנים (Agents) ומערכות RAG (Retrieval-Augmented Generation) יעילות ומהירות במיוחד.

כדי להתחיל לעבוד עם Llama 3.x, הדרך הפשוטה והמהירה ביותר היא שימוש בכלים כמו Ollama, המאפשר להריץ את המודל מקומית בפקודה אחת פשוטה, או בפרויקט llama.cpp המאפשר ביצועים אופטימליים על מעבדים רגילים (CPU) וכרטיסי מסך מגוונים באמצעות קוונטיזציה (Quantization) בפורמט GGUF. לאחר שהמודל רץ מקומית, ניתן לחבר אותו בקלות לספריות פיתוח פופולריות כמו LlamaIndex כדי להתחיל לתשאל מסמכים ולבנות יישומי בינה מלאכותית מתקדמים.

הנה דוגמה קצרה המציגה כיצד לפנות למודל Llama 3 הרץ באופן מקומי באמצעות Ollama ולתשאל אותו בעזרת קוד Python פשוט:

import requests

url = "http://localhost:11434/api/generate"
payload = {
    "model": "llama3",
    "prompt": "Explain briefly what a Large Language Model is.",
    "stream": False
}

response = requests.post(url, json=payload)
print(response.json().get("response"))

ככל שהפרויקט שלכם גדל, תרצו לשלב את Llama 3.x עם מנועי חיפוש ומאגרי מידע. ספריות כמו LlamaIndex מעדכנות באופן תדיר את התמיכה שלהן במודלים אלו ובאינטגרציות השונות. מומלץ לעקוב אחר העדכונים האחרונים, כגון LlamaIndex v0.14.19 וכן LlamaIndex v0.14.18, המציגים שיפורים בליבת המערכת וביכולות העבודה עם סוכני AI ומודלים מקומיים, כפי שמתואר גם בגרסת llama-index-core 0.14.16.

הצעד הבא שלכם: הורידו והתקינו את Ollama במחשב שלכם. לאחר ההתקנה, פתחו את הטרמינל והריצו את הפקודה ollama run llama3 כדי להתחיל לשוחח עם המודל ישירות מה-CLI. לאחר מכן, נסו להריץ את קוד הפייתון שלמעלה כדי לחבר את המודל לאפליקציה הראשונה שלכם!

פרויקטי התחלה2 REPOS
Ollama
★ 100k
go מתחילים
דרך הכי מהירה להריץ Llama/Qwen/DeepSeek/Mistral מקומית. CLI + REST API.
curl -fsSL https://ollama.com/install.sh | sh && ollama run llama3.3
GitHub ↗
llama.cpp
★ 70k
cpp בינוני
אינפרנס C++ נטו. הכי מהיר ל-CPU/Metal. GGUF quantization.
git clone https://github.com/ggerganov/llama.cpp && make
GitHub ↗
חומרי קריאה8 פריטים
01YT Cole Medin · וידאו · בינוני
בסיס הידע האולטימטיבי: הבא את YouTube לתוך מוח ה-AI השני שלך
הפיכת ערוצי YouTube לבסיסי ידע עם Claude Code. המערכת משתמשת ב-Google OKF, תקן חדש לוויקים של LLM, ומאפשרת לסוכנים ללמוד מידית. היא תומכת בהמרה למרקדאון ויכולה לשמש עם Obsidian.
02YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
03YT AI Engineer · וידאו · מתקדם
הנדסת פרסונה: מדריך שדה לפרסונות סינתטיות
פרסונות סינתטיות משוכללות מתאימות לבני אדם במחקרי שוק. קבוצת מחקר השתמשה במודל LLM כדי ליצור פרסונות סינתטיות שחיקו את התשובות של בני אדם. התוצאות הראו שהפרסונות הסינתטיות היו דומות מאוד לתשובות האנושיות, אך עם פחות רעש.
04YT Matthew Berman · וידאו · בינוני
אכזבה
אנתרופיק פרסמה מודל משקלים פתוח. מטא-איי דלפה את המודל לאמה. נידון האם הקוד הפתוח ינצח.
05YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
06YT AI Engineer · וידאו · מתקדם
אל תנו ל-LLM לנהוג
במערכת הדיבור של מיקרוסופט, LLM אינו קובע את סיום השיעור. ה-LLM רק 'מדבר' ומקבל הוראות. מנגנון 'הארנס' אחראי על בקרת הזרימה. המערכת משתמשת במכונות מצב קטנות כדי לווסת את ה-LLM.
07YT AI Engineer · וידאו · מתקדם
בניית Evals שדואגות למציאות
חברת Lyft פיתחה סימולטור משתמשים אדוורסרי לבדיקות אופליין. הסימולטור מבוסס LLM מותאם היטב, המדמה משתמשים מבולבלים, כועסים ואדוורסריים. הגישה הזאת מאפשרת לחברה לזהות בעיות בשלב מוקדם.
08Ahead of AI · כתבה · מתקדם
בקרת מאמץ תהליכי היגיון במודלים LLM
מודלים LLM עם יכולת תהליכי היגיון הפכו לחלק סטנדרטי ממודלים מודרניים. OpenAI הוציאה את מודל GPT-5.6 עם הגדרות מאמץ תהליכי היגיון משתנות.
03

משפחת Llama

Llama 3.x — מתחילים, גדלים שונים, instruction-tuned.

~3 שעותבינוני
שיעור

משפחת מודלי Llama מבית Meta חוללה מהפכה בעולם ה-AI בקוד פתוח, כאשר סדרת Llama 3.x מייצגת את חזית הטכנולוגיה הנוכחית עבור מפתחים וחוקרים. מודלים אלו אומנו על כמויות עצומות של נתונים (טריליוני tokens) ומציעים ביצועים המתחרים במודלים מסחריים סגורים. הסדרה כוללת מודלים בגדלים שונים (כמו 8B, 70B ו-405B) המותאמים לצרכים שונים – החל מהרצה מקומית על מחשב נייד ועד לפריסות ענן מסיביות, כאשר גרסאות ה-Instruction-tuned עברו כוונון עדין מיוחד כדי להבין ולבצע הוראות מורכבות של משתמשים בצורה טבעית ומדויקת.

השימוש ב-Llama 3.x מומלץ במיוחד כאשר יש צורך בפרטיות מידע מלאה, שליטה בעלויות ה-Inference, או התאמה אישית (Fine-tuning) של המודל למשימות ספציפיות. בניגוד לשימוש ב-APIs סגורים של חברות כמו OpenAI או Anthropic, הרצת Llama 3.x מקומית או על שרת פרטי מבטיחה שהנתונים הרגישים שלכם לעולם לא יעזבו את הארגון. בנוסף, הגרסאות הקטנות יותר (כמו Llama 3 8B) מציעות יחס עלות-תועלת מעולה, ומאפשרות לבנות יישומי סוכנים (Agents) ומערכות RAG (Retrieval-Augmented Generation) יעילות ומהירות במיוחד.

כדי להתחיל לעבוד עם Llama 3.x, הדרך הפשוטה והמהירה ביותר היא שימוש בכלים כמו Ollama, המאפשר להריץ את המודל מקומית בפקודה אחת פשוטה, או בפרויקט llama.cpp המאפשר ביצועים אופטימליים על מעבדים רגילים (CPU) וכרטיסי מסך מגוונים באמצעות קוונטיזציה (Quantization) בפורמט GGUF. לאחר שהמודל רץ מקומית, ניתן לחבר אותו בקלות לספריות פיתוח פופולריות כמו LlamaIndex כדי להתחיל לתשאל מסמכים ולבנות יישומי בינה מלאכותית מתקדמים.

הנה דוגמה קצרה המציגה כיצד לפנות למודל Llama 3 הרץ באופן מקומי באמצעות Ollama ולתשאל אותו בעזרת קוד Python פשוט:

import requests

url = "http://localhost:11434/api/generate"
payload = {
    "model": "llama3",
    "prompt": "Explain briefly what a Large Language Model is.",
    "stream": False
}

response = requests.post(url, json=payload)
print(response.json().get("response"))

ככל שהפרויקט שלכם גדל, תרצו לשלב את Llama 3.x עם מנועי חיפוש ומאגרי מידע. ספריות כמו LlamaIndex מעדכנות באופן תדיר את התמיכה שלהן במודלים אלו ובאינטגרציות השונות. מומלץ לעקוב אחר העדכונים האחרונים, כגון LlamaIndex v0.14.19 וכן LlamaIndex v0.14.18, המציגים שיפורים בליבת המערכת וביכולות העבודה עם סוכני AI ומודלים מקומיים, כפי שמתואר גם בגרסת llama-index-core 0.14.16.

הצעד הבא שלכם: הורידו והתקינו את Ollama במחשב שלכם. לאחר ההתקנה, פתחו את הטרמינל והריצו את הפקודה ollama run llama3 כדי להתחיל לשוחח עם המודל ישירות מה-CLI. לאחר מכן, נסו להריץ את קוד הפייתון שלמעלה כדי לחבר את המודל לאפליקציה הראשונה שלכם!

פרויקטי התחלה2 REPOS
Ollama
★ 100k
go מתחילים
דרך הכי מהירה להריץ Llama/Qwen/DeepSeek/Mistral מקומית. CLI + REST API.
curl -fsSL https://ollama.com/install.sh | sh && ollama run llama3.3
GitHub ↗
llama.cpp
★ 70k
cpp בינוני
אינפרנס C++ נטו. הכי מהיר ל-CPU/Metal. GGUF quantization.
git clone https://github.com/ggerganov/llama.cpp && make
GitHub ↗
חומרי קריאה8 פריטים
01YT Cole Medin · וידאו · בינוני
בסיס הידע האולטימטיבי: הבא את YouTube לתוך מוח ה-AI השני שלך
הפיכת ערוצי YouTube לבסיסי ידע עם Claude Code. המערכת משתמשת ב-Google OKF, תקן חדש לוויקים של LLM, ומאפשרת לסוכנים ללמוד מידית. היא תומכת בהמרה למרקדאון ויכולה לשמש עם Obsidian.
02YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
03YT AI Engineer · וידאו · מתקדם
הנדסת פרסונה: מדריך שדה לפרסונות סינתטיות
פרסונות סינתטיות משוכללות מתאימות לבני אדם במחקרי שוק. קבוצת מחקר השתמשה במודל LLM כדי ליצור פרסונות סינתטיות שחיקו את התשובות של בני אדם. התוצאות הראו שהפרסונות הסינתטיות היו דומות מאוד לתשובות האנושיות, אך עם פחות רעש.
04YT Matthew Berman · וידאו · בינוני
אכזבה
אנתרופיק פרסמה מודל משקלים פתוח. מטא-איי דלפה את המודל לאמה. נידון האם הקוד הפתוח ינצח.
05YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
06YT AI Engineer · וידאו · מתקדם
אל תנו ל-LLM לנהוג
במערכת הדיבור של מיקרוסופט, LLM אינו קובע את סיום השיעור. ה-LLM רק 'מדבר' ומקבל הוראות. מנגנון 'הארנס' אחראי על בקרת הזרימה. המערכת משתמשת במכונות מצב קטנות כדי לווסת את ה-LLM.
07YT AI Engineer · וידאו · מתקדם
בניית Evals שדואגות למציאות
חברת Lyft פיתחה סימולטור משתמשים אדוורסרי לבדיקות אופליין. הסימולטור מבוסס LLM מותאם היטב, המדמה משתמשים מבולבלים, כועסים ואדוורסריים. הגישה הזאת מאפשרת לחברה לזהות בעיות בשלב מוקדם.
08Ahead of AI · כתבה · מתקדם
בקרת מאמץ תהליכי היגיון במודלים LLM
מודלים LLM עם יכולת תהליכי היגיון הפכו לחלק סטנדרטי ממודלים מודרניים. OpenAI הוציאה את מודל GPT-5.6 עם הגדרות מאמץ תהליכי היגיון משתנות.
04

Qwen + DeepSeek

מודלים סיניים מובילים — תכונות ייחודיות, ביצועים.

~3 שעותבינוני
שיעור

בשנים האחרונות, עולם ה-AI חווה תפנית דרמטית עם פריצתם של מודלים מובילים מסין, ובראשם Qwen (מבית Alibaba) ו-DeepSeek. מודלים אלו אינם רק אלטרנטיבה למודלים המערביים המוכרים, אלא לעיתים קרובות מובילים במדדי הביצועים (Benchmarks) העולמיים, במיוחד בתחומי התכנות, המתמטיקה והחשיבה הלוגית (Reasoning). הם מציעים ארכיטקטורות מתקדמות ויעילות כלכלית יוצאת דופן, מה שהופך אותם לבחירה מועדפת עבור מפתחים וחוקרים ברחבי העולם.

הכוח של מודלים אלו טמון ביעילות הארכיטקטונית שלהם. מודלי DeepSeek, למשל, עושים שימוש נרחב בטכנולוגיית Mixture of Experts (MoE) המאפשרת להפעיל רק חלק קטן מהפרמטרים בכל שאילתה, ובכך לחסוך משאבי חישוב עצומים מבלי לפגוע באיכות התשובה. מנגד, סדרת Qwen2.5 מציעה ביצועים פנומנליים במגוון שפות ויכולות קידוד שמאתגרות את המודלים הסגורים המובילים בשוק. השימוש במודלים אלו מומלץ במיוחד כאשר נדרשת פריסה מקומית (On-premise) של מודלים חזקים, או כאשר יש צורך בביצועים גבוהים בעלויות תפעול נמוכות.

עם זאת, העבודה עם מודלים אלו מביאה איתה אתגרים ייחודיים. ראשית, בשל גודלם, הרצתם על חומרה מקומית דורשת שימוש בטכניקות דחיסה וקוונטיזציה מתקדמות, כפי שמתואר במחקר על שיטת דחיסה טנסורית יעילה למודלי שפה גדולים. שנית, מפתחים צריכים להיות מודעים להבדלים תרבותיים וגאו-פוליטיים המשפיעים על אופן אימון המודלים והטיית התוכן שלהם, נושא שנחקר בהרחבה במאמר על הטיה גיאופוליטית במודלים לשוניים.

כדי להתחיל לעבוד עם מודלים אלו בצורה פשוטה ויעילה, הדרך המומלצת ביותר היא שימוש בכלי Ollama, המאפשר להריץ מודלי קצה מקומית על המחשב האישי שלכם בלחיצת כפתור. בעזרת Ollama תוכלו למשוך גרסאות מותאמות של Qwen או DeepSeek ולהשתמש בהן ישירות מתוך קוד Python.

להלן דוגמה מינימלית להרצת שאילתה מקומית מול מודל DeepSeek באמצעות ספריית Python הרשמית של Ollama:

import ollama

# שליחת שאילתה למודל DeepSeek-R1 המורץ מקומית
response = ollama.chat(model='deepseek-r1:8b', messages=[
    {
        'role': 'user',
        'content': 'Explain the difference between MoE and dense LLMs in one sentence.',
    },
])

print(response['message']['content'])

הצעד הבא שלכם:

הורידו והתקינו את Ollama על המחשב שלכם. לאחר מכן, פתחו את הטרמינל והריצו את הפקודה ollama run deepseek-r1:8b (או qwen2.5:14b). הפרויקט הראשון שלכם יהיה לבנות סקריפט Python קצר המשתמש במודל המקומי כדי לנתח קובץ קוד מקור ולמצוא בו באגים - ללא צורך בחיבור לאינטרנט או בתשלום על API!

פרויקטי התחלה1 REPOS
Qwen + DeepSeek via Ollama
★ 100k
go מתחילים
מודלים סיניים מובילים — ollama pull qwen2.5:72b / deepseek-r1.
ollama pull qwen2.5:72b
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
בדיקת וידאו מלאכותי
חברת Character.ai פיתחה שיטה לבדיקת וידאו מלאכותי. השיטה משתמשת במודל Qwen3-VL כדי להעריך איכות הווידאו. המודל מאפשר לזהות בעיות כגון חוסר עקביות זמנית ואיכות ירודה.
02YT AI Engineer · וידאו · מתקדם
מפעל שחולם: 39 סוכנים AI, ללא פריימוורק
חברה הודית בנתה מערכת הפעלה רב-סוכנית AI, המורכבת מ-39 סוכנים מומחים, ללא שימוש בפריימוורק. המערכת, הנקראת Ira, משמשת כמוח החברה, ומטפלת במשימות עסקיות שונות, כגון מכירות, פיתוח עסקי, גיוס, וניהול.
03Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
04YT IndyDevDan · וידאו · מתקדם
GLM-5.2 ו-MiniMax-M3: תחרות אמיתית ל-Opus
GLM-5.2 ו-MiniMax-M3 הם מודלים חדשים שמתחרים ב-Opus. GLM-5.2 הוא המודל המוביל ב-Intelligence Index, ו-MiniMax-M3 הוא המודל הזול יותר. השניים מתחרים בביצועים ובמחיר.
05MarkTechPost · כתבה · מתקדם
DeepReinforce משחרר Ornith-1.0: משפחת מודלים קודים פתוחים
DeepReinforce השחררה את Ornith-1.0, משפחת מודלים פתוחים לקודים. המודלים מבוססים על Gemma 4 ו-Qwen 3.5. Ornith-1.0 לומדת לכתוב את הסקאפולד שלה בעצמה, והיא כוללת ארבעה גדלים: 9B, 31B, 35B-MoE ו-397B-MoE.
06MarkTechPost · כתבה · מתקדם
VibeThinker-3B: מודל גדנסי להיגיון
VibeThinker-3B הוא מודל גדנסי להיגיון שפותח על בסיס Qwen2.5-Coder-3B. המודל משתמש בטכניקות כמו עידון מונחה ולמידת חיזוק. הוא מתמקד במשימות היגיון שניתן לאמת את התשובות.
07MarkTechPost · כתבה · מתקדם
Zyphra משחררת Zamba2-VL: מודלים היברידיים לראייה-שפה
Zyphra השחררה את Zamba2-VL, מודל ראייה-שפה היברידי המשלב יכולות ראייה ושפה. המודל מבוסס על ארכיטקטורת Zamba2 היברידית, הכוללת שכבות Mamba2 ובלוקים משותפים. Zamba2-VL תומכת בהבנה והקשר של תמונות וטקסט.
08MarkTechPost · כתבה · מתקדם
אליבאבה משיקה Qwen3.7-Plus
צוות Qwen של אליבאבה השיק Qwen3.7-Plus, מודל שפה רב-מודאלי המבין תמונות ווידאו. המודל מוסיף יכולות עמוקות כגון היגיון עמוק, הפעלת כלים ואיטרציה אוטונומית.
05

Qwen + DeepSeek

מודלים סיניים מובילים — תכונות ייחודיות, ביצועים.

~3 שעותבינוני
שיעור

בשנים האחרונות, עולם ה-AI חווה תפנית דרמטית עם פריצתם של מודלים מובילים מסין, ובראשם Qwen (מבית Alibaba) ו-DeepSeek. מודלים אלו אינם רק אלטרנטיבה למודלים המערביים המוכרים, אלא לעיתים קרובות מובילים במדדי הביצועים (Benchmarks) העולמיים, במיוחד בתחומי התכנות, המתמטיקה והחשיבה הלוגית (Reasoning). הם מציעים ארכיטקטורות מתקדמות ויעילות כלכלית יוצאת דופן, מה שהופך אותם לבחירה מועדפת עבור מפתחים וחוקרים ברחבי העולם.

הכוח של מודלים אלו טמון ביעילות הארכיטקטונית שלהם. מודלי DeepSeek, למשל, עושים שימוש נרחב בטכנולוגיית Mixture of Experts (MoE) המאפשרת להפעיל רק חלק קטן מהפרמטרים בכל שאילתה, ובכך לחסוך משאבי חישוב עצומים מבלי לפגוע באיכות התשובה. מנגד, סדרת Qwen2.5 מציעה ביצועים פנומנליים במגוון שפות ויכולות קידוד שמאתגרות את המודלים הסגורים המובילים בשוק. השימוש במודלים אלו מומלץ במיוחד כאשר נדרשת פריסה מקומית (On-premise) של מודלים חזקים, או כאשר יש צורך בביצועים גבוהים בעלויות תפעול נמוכות.

עם זאת, העבודה עם מודלים אלו מביאה איתה אתגרים ייחודיים. ראשית, בשל גודלם, הרצתם על חומרה מקומית דורשת שימוש בטכניקות דחיסה וקוונטיזציה מתקדמות, כפי שמתואר במחקר על שיטת דחיסה טנסורית יעילה למודלי שפה גדולים. שנית, מפתחים צריכים להיות מודעים להבדלים תרבותיים וגאו-פוליטיים המשפיעים על אופן אימון המודלים והטיית התוכן שלהם, נושא שנחקר בהרחבה במאמר על הטיה גיאופוליטית במודלים לשוניים.

כדי להתחיל לעבוד עם מודלים אלו בצורה פשוטה ויעילה, הדרך המומלצת ביותר היא שימוש בכלי Ollama, המאפשר להריץ מודלי קצה מקומית על המחשב האישי שלכם בלחיצת כפתור. בעזרת Ollama תוכלו למשוך גרסאות מותאמות של Qwen או DeepSeek ולהשתמש בהן ישירות מתוך קוד Python.

להלן דוגמה מינימלית להרצת שאילתה מקומית מול מודל DeepSeek באמצעות ספריית Python הרשמית של Ollama:

import ollama

# שליחת שאילתה למודל DeepSeek-R1 המורץ מקומית
response = ollama.chat(model='deepseek-r1:8b', messages=[
    {
        'role': 'user',
        'content': 'Explain the difference between MoE and dense LLMs in one sentence.',
    },
])

print(response['message']['content'])

הצעד הבא שלכם:

הורידו והתקינו את Ollama על המחשב שלכם. לאחר מכן, פתחו את הטרמינל והריצו את הפקודה ollama run deepseek-r1:8b (או qwen2.5:14b). הפרויקט הראשון שלכם יהיה לבנות סקריפט Python קצר המשתמש במודל המקומי כדי לנתח קובץ קוד מקור ולמצוא בו באגים - ללא צורך בחיבור לאינטרנט או בתשלום על API!

פרויקטי התחלה1 REPOS
Qwen + DeepSeek via Ollama
★ 100k
go מתחילים
מודלים סיניים מובילים — ollama pull qwen2.5:72b / deepseek-r1.
ollama pull qwen2.5:72b
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
בדיקת וידאו מלאכותי
חברת Character.ai פיתחה שיטה לבדיקת וידאו מלאכותי. השיטה משתמשת במודל Qwen3-VL כדי להעריך איכות הווידאו. המודל מאפשר לזהות בעיות כגון חוסר עקביות זמנית ואיכות ירודה.
02YT AI Engineer · וידאו · מתקדם
מפעל שחולם: 39 סוכנים AI, ללא פריימוורק
חברה הודית בנתה מערכת הפעלה רב-סוכנית AI, המורכבת מ-39 סוכנים מומחים, ללא שימוש בפריימוורק. המערכת, הנקראת Ira, משמשת כמוח החברה, ומטפלת במשימות עסקיות שונות, כגון מכירות, פיתוח עסקי, גיוס, וניהול.
03Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
04YT IndyDevDan · וידאו · מתקדם
GLM-5.2 ו-MiniMax-M3: תחרות אמיתית ל-Opus
GLM-5.2 ו-MiniMax-M3 הם מודלים חדשים שמתחרים ב-Opus. GLM-5.2 הוא המודל המוביל ב-Intelligence Index, ו-MiniMax-M3 הוא המודל הזול יותר. השניים מתחרים בביצועים ובמחיר.
05MarkTechPost · כתבה · מתקדם
DeepReinforce משחרר Ornith-1.0: משפחת מודלים קודים פתוחים
DeepReinforce השחררה את Ornith-1.0, משפחת מודלים פתוחים לקודים. המודלים מבוססים על Gemma 4 ו-Qwen 3.5. Ornith-1.0 לומדת לכתוב את הסקאפולד שלה בעצמה, והיא כוללת ארבעה גדלים: 9B, 31B, 35B-MoE ו-397B-MoE.
06MarkTechPost · כתבה · מתקדם
VibeThinker-3B: מודל גדנסי להיגיון
VibeThinker-3B הוא מודל גדנסי להיגיון שפותח על בסיס Qwen2.5-Coder-3B. המודל משתמש בטכניקות כמו עידון מונחה ולמידת חיזוק. הוא מתמקד במשימות היגיון שניתן לאמת את התשובות.
07MarkTechPost · כתבה · מתקדם
Zyphra משחררת Zamba2-VL: מודלים היברידיים לראייה-שפה
Zyphra השחררה את Zamba2-VL, מודל ראייה-שפה היברידי המשלב יכולות ראייה ושפה. המודל מבוסס על ארכיטקטורת Zamba2 היברידית, הכוללת שכבות Mamba2 ובלוקים משותפים. Zamba2-VL תומכת בהבנה והקשר של תמונות וטקסט.
08MarkTechPost · כתבה · מתקדם
אליבאבה משיקה Qwen3.7-Plus
צוות Qwen של אליבאבה השיק Qwen3.7-Plus, מודל שפה רב-מודאלי המבין תמונות ווידאו. המודל מוסיף יכולות עמוקות כגון היגיון עמוק, הפעלת כלים ואיטרציה אוטונומית.
06

Fine-tuning

LoRA, QLoRA, full SFT — מתי, איך, ועם איזה כלים.

~5 שעותמתקדם
שיעור

כאשר אנו נדרשים להתאים מודל שפה גדול (LLM) למשימות ספציפיות, לעיצוב סגנון כתיבה ייחודי או להבנת דומיין מקצועי צר, שימוש ב-Prompt Engineering או RAG לא תמיד מספיק. כאן נכנס לתמונה תהליך ה-Fine-tuning (כוונון עדין). ברמת המתקדמים, אנו מבחינים בין שלוש גישות מרכזיות: Full Supervised Fine-Tuning (Full SFT), LoRA (Low-Rank Adaptation), ו-QLoRA (Quantized LoRA). הבנת ההבדלים ביניהן קריטית לניהול יעיל של משאבי מחשוב (Compute) וזמן ריצה.

שיטת Full SFT מעדכנת את כל המשקולות של המודל. היא מניבה את התוצאות המדויקות ביותר עבור שינויים התנהגותיים עמוקים, אך דורשת משאבי חומרה עצומים (מערכים מרובי GPUs). לעומתה, LoRA מקפיאה את משקולות המקור ומחדירה מטריצות קטנות ורזות (Low-Rank) לשכבות הצימוד (Attention), מה שמפחית את הזיכרון הנדרש באופן דרמטי. QLoRA לוקחת את זה צעד קדימה ומבצעת קוונטיזציה של מודל הבסיס ל-4-bit, מה שמאפשר להריץ Fine-tuning של מודלים ענקיים על גבי GPU צרכני בודד מבלי לפגוע כמעט בביצועים.

כדי ליישם את השיטות הללו בפועל, קהילת ה-Open Source מציעה שני כלים מובילים. הראשון הוא unsloth, ספרייה המאפשרת האצה של פי 2 במהירות וחיסכון של עד 80% בזיכרון ה-VRAM עבור מודלים פופולריים כמו Llama 3 ו-Mistral. הכלי השני הוא axolotl, פלטפורמה מבוססת קובצי קונפיגורציה (YAML) המיועדת לאימונים מבוזרים ומורכבים על גבי מספר כרטיסי מסך (Multi-GPU).

להלן דוגמה קצרה ופשוטה לשימוש ב-Unsloth לצורך טעינת מודל והכנתו ל-LoRA מהיר:

from unsloth import FastLanguageModel
import torch

max_seq_length = 2048
model, tokenizer = FastLanguageModel.from_pretrained(
    model_name = "unsloth/llama-3-8b-Instruct-bnb-4bit",
    max_seq_length = max_seq_length,
    load_in_4bit = True,
)

model = FastLanguageModel.get_peft_model(
    model,
    r = 16,
    target_modules = ["q_proj", "k_proj", "v_proj", "o_proj"],
    lora_alpha = 16,
    lora_dropout = 0,
    bias = "none",
)

לאחר שהמודל עבר התאמה אישית, הוא הופך ללב הפועם של מערכות מורכבות יותר. שילוב מודלים מותאמים אישית בתוך סוכני AI (Agents) מאפשר להשיג רמת ביצועים חסרת תקדים. כדי להבין כיצד לנהל את מחזור החיים של סוכנים אלו ולשמור על עקביות, מומלץ לקרוא על פיתוחים אחרונים בניהול State בגרסת LangGraph 1.2.1 או להעמיק בניהול זיכרון מתקדם עם langgraph-checkpoint 4.1.1. בנוסף, לדיון מרתק על האופן שבו מודלים מותאמים אישית מעצבים מחדש את תהליכי היצירה האנושיים, מומלץ לעיין במאמר הגברת יצירתיות בעידן ה-AI של MIT Tech Review.

הצעד הבא שלך: התחל בהרצת מחברת ה-Colab הרשמית של unsloth. בחר במודל Llama 3 8B, טען סט נתונים קטן משלך בפורמט Instruction (למשל, קובץ JSON פשוט המכיל שאלות ותשובות), והרץ אימון QLoRA מהיר בחינם. זה ייתן לך הבנה מעשית ראשונה של מהירות האימון וצריכת הזיכרון בפועל.

פרויקטי התחלה2 REPOS
unsloth
★ 22k
python מתקדם
Fine-tuning מהיר פי 2 וזיכרון פי 4 פחות. תומך LoRA/QLoRA/full SFT לכל המשפחות.
pip install unsloth
GitHub ↗
axolotl
★ 8k
python מתקדם
YAML-based fine-tuning, multi-GPU, distributed.
pip install axolotl
GitHub ↗
חומרי קריאה8 פריטים
01Pydantic AI · כתבה · מתקדם
pydantic-ai v2.21.0
שוחררה גרסה v2.21.0 של pydantic-ai. הגרסה החדשה כוללת תכונות חדשות ותיקוני באגים, כולל הוספת per_request_input_tokens_limit ל-UsageLimits ורענון KnownModelName מ-Gateway probes ו-Google image IDs.
02YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
03YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
04YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
05YT AI Engineer · וידאו · מתקדם
ALPHALAB של Morgan Stanley: מחקר רב-סוכנים
ALPHALAB הוא מערכת רב-סוכנים שפיתחה Morgan Stanley. המערכת מקבלת בעיה בשפה טבעית, כותבת קוד, מבצעת בדיקות ואופטימיזציה. היא כוללת סוכנים אסטרטגיים וסוכנים עובדים, ומאפשרת עריכה ואישור לפני ביצוע.
06YT AI Engineer · וידאו · מתקדם
סוכנים לקבוצות, לא רק למשתמש יחיד
סוכנים מותאמים לקבוצות, ולא רק למשתמשים יחידים, דורשים פתרונות חדשים לבעיות אבטחה וזיכרון. סאי קרישנה ראלאבאנדי מציג פתרון להגנה על סוכנים בקבוצות, עם מודל קטן ואדפטרים למשתמשים.
07YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
08Pydantic AI · כתבה · מתקדם
עדכון pydantic-ai v2.19.0
עדכון pydantic-ai v2.19.0 כולל תיקוני באגים ושיפורים. נוספו headers ו-retry_after ל-ModelHTTPError. העדכון כולל גם עדכון תלות FastMCP.
07

Fine-tuning

LoRA, QLoRA, full SFT — מתי, איך, ועם איזה כלים.

~5 שעותמתקדם
שיעור

כאשר אנו נדרשים להתאים מודל שפה גדול (LLM) למשימות ספציפיות, לעיצוב סגנון כתיבה ייחודי או להבנת דומיין מקצועי צר, שימוש ב-Prompt Engineering או RAG לא תמיד מספיק. כאן נכנס לתמונה תהליך ה-Fine-tuning (כוונון עדין). ברמת המתקדמים, אנו מבחינים בין שלוש גישות מרכזיות: Full Supervised Fine-Tuning (Full SFT), LoRA (Low-Rank Adaptation), ו-QLoRA (Quantized LoRA). הבנת ההבדלים ביניהן קריטית לניהול יעיל של משאבי מחשוב (Compute) וזמן ריצה.

שיטת Full SFT מעדכנת את כל המשקולות של המודל. היא מניבה את התוצאות המדויקות ביותר עבור שינויים התנהגותיים עמוקים, אך דורשת משאבי חומרה עצומים (מערכים מרובי GPUs). לעומתה, LoRA מקפיאה את משקולות המקור ומחדירה מטריצות קטנות ורזות (Low-Rank) לשכבות הצימוד (Attention), מה שמפחית את הזיכרון הנדרש באופן דרמטי. QLoRA לוקחת את זה צעד קדימה ומבצעת קוונטיזציה של מודל הבסיס ל-4-bit, מה שמאפשר להריץ Fine-tuning של מודלים ענקיים על גבי GPU צרכני בודד מבלי לפגוע כמעט בביצועים.

כדי ליישם את השיטות הללו בפועל, קהילת ה-Open Source מציעה שני כלים מובילים. הראשון הוא unsloth, ספרייה המאפשרת האצה של פי 2 במהירות וחיסכון של עד 80% בזיכרון ה-VRAM עבור מודלים פופולריים כמו Llama 3 ו-Mistral. הכלי השני הוא axolotl, פלטפורמה מבוססת קובצי קונפיגורציה (YAML) המיועדת לאימונים מבוזרים ומורכבים על גבי מספר כרטיסי מסך (Multi-GPU).

להלן דוגמה קצרה ופשוטה לשימוש ב-Unsloth לצורך טעינת מודל והכנתו ל-LoRA מהיר:

from unsloth import FastLanguageModel
import torch

max_seq_length = 2048
model, tokenizer = FastLanguageModel.from_pretrained(
    model_name = "unsloth/llama-3-8b-Instruct-bnb-4bit",
    max_seq_length = max_seq_length,
    load_in_4bit = True,
)

model = FastLanguageModel.get_peft_model(
    model,
    r = 16,
    target_modules = ["q_proj", "k_proj", "v_proj", "o_proj"],
    lora_alpha = 16,
    lora_dropout = 0,
    bias = "none",
)

לאחר שהמודל עבר התאמה אישית, הוא הופך ללב הפועם של מערכות מורכבות יותר. שילוב מודלים מותאמים אישית בתוך סוכני AI (Agents) מאפשר להשיג רמת ביצועים חסרת תקדים. כדי להבין כיצד לנהל את מחזור החיים של סוכנים אלו ולשמור על עקביות, מומלץ לקרוא על פיתוחים אחרונים בניהול State בגרסת LangGraph 1.2.1 או להעמיק בניהול זיכרון מתקדם עם langgraph-checkpoint 4.1.1. בנוסף, לדיון מרתק על האופן שבו מודלים מותאמים אישית מעצבים מחדש את תהליכי היצירה האנושיים, מומלץ לעיין במאמר הגברת יצירתיות בעידן ה-AI של MIT Tech Review.

הצעד הבא שלך: התחל בהרצת מחברת ה-Colab הרשמית של unsloth. בחר במודל Llama 3 8B, טען סט נתונים קטן משלך בפורמט Instruction (למשל, קובץ JSON פשוט המכיל שאלות ותשובות), והרץ אימון QLoRA מהיר בחינם. זה ייתן לך הבנה מעשית ראשונה של מהירות האימון וצריכת הזיכרון בפועל.

פרויקטי התחלה2 REPOS
unsloth
★ 22k
python מתקדם
Fine-tuning מהיר פי 2 וזיכרון פי 4 פחות. תומך LoRA/QLoRA/full SFT לכל המשפחות.
pip install unsloth
GitHub ↗
axolotl
★ 8k
python מתקדם
YAML-based fine-tuning, multi-GPU, distributed.
pip install axolotl
GitHub ↗
חומרי קריאה8 פריטים
01Pydantic AI · כתבה · מתקדם
pydantic-ai v2.21.0
שוחררה גרסה v2.21.0 של pydantic-ai. הגרסה החדשה כוללת תכונות חדשות ותיקוני באגים, כולל הוספת per_request_input_tokens_limit ל-UsageLimits ורענון KnownModelName מ-Gateway probes ו-Google image IDs.
02YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
03YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
04YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
05YT AI Engineer · וידאו · מתקדם
ALPHALAB של Morgan Stanley: מחקר רב-סוכנים
ALPHALAB הוא מערכת רב-סוכנים שפיתחה Morgan Stanley. המערכת מקבלת בעיה בשפה טבעית, כותבת קוד, מבצעת בדיקות ואופטימיזציה. היא כוללת סוכנים אסטרטגיים וסוכנים עובדים, ומאפשרת עריכה ואישור לפני ביצוע.
06YT AI Engineer · וידאו · מתקדם
סוכנים לקבוצות, לא רק למשתמש יחיד
סוכנים מותאמים לקבוצות, ולא רק למשתמשים יחידים, דורשים פתרונות חדשים לבעיות אבטחה וזיכרון. סאי קרישנה ראלאבאנדי מציג פתרון להגנה על סוכנים בקבוצות, עם מודל קטן ואדפטרים למשתמשים.
07YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
08Pydantic AI · כתבה · מתקדם
עדכון pydantic-ai v2.19.0
עדכון pydantic-ai v2.19.0 כולל תיקוני באגים ושיפורים. נוספו headers ו-retry_after ל-ModelHTTPError. העדכון כולל גם עדכון תלות FastMCP.
08

Inference: vLLM / TGI

הרצה מקומית או על שרת — throughput, batching, quantization.

~4 שעותמתקדם
שיעור

כשמדובר בפריסה של מודלי שפה גדולים (LLMs) בסביבת ייצור (Production), הרצה פשוטה באמצעות ספריות כמו transformers של Hugging Face כבר אינה מספיקה. כאן נכנסים לתמונה מנועי Inference מתקדמים כמו vLLM ו-TGI (Text Generation Inference). מנועים אלו תוכננו במיוחד כדי למקסם את ה-throughput (קצב הפקת הטוקנים) ולמזער את ה-latency (זמן התגובה) על ידי אופטימיזציות ברמת החומרה והזיכרון.

מדוע אנו זקוקים להם? האתגר הגדול ביותר בהרצת LLMs הוא ניהול זיכרון ה-KV Cache (מפתח-ערך) של המודל. טכנולוגיית PagedAttention, שהוצגה לראשונה ב-vLLM, פותרת את בעיית הפרגמנטציה של הזיכרון על ידי חלוקתו לדפים דינמיים, בדומה לניהול זיכרון וירטואלי במערכות הפעלה. בנוסף, מנגנון ה-Continuous Batching (או In-flight Batching) מאפשר להכניס בקשות חדשות ל-batch הקיים בזמן אמת מבלי להמתין שכל הבקשות הקודמות יסתיימו, מה שמעלה את הניצולת של ה-GPU במאות אחוזים.

כדי להריץ מודלים ענקיים על חומרה מוגבלת, מנועים אלו תומכים בטכניקות דחיסה וקוונטיזציה (Quantization) מתקדמות כמו AWQ, GPTQ ו-FP8. שימוש בפורמטים אלו מאפשר להקטין את נפח המודל בזיכרון ה-VRAM כמעט ללא פגיעה בדיוק הכללי של המודל. בחירה בפתרון כמו vLLM מאפשרת גם חשיפה קלה של השרת כ-API התואם לחלוטין ל-OpenAI, מה שמקל על אינטגרציה מהירה עם ספריות קיימות.

הנה דוגמה קצרה ופשוטה להרצת מודל מקומי באמצעות vLLM וכתיבת קוד Python מהיר להפקת טקסט:

from vllm import LLM, SamplingParams

# טעינת המודל עם תמיכה ב-PagedAttention באופן אוטומטי
llm = LLM(model="facebook/opt-125m")

# הגדרת פרמטרים להפקה
sampling_params = SamplingParams(temperature=0.8, top_p=0.95, max_tokens=50)

# הרצת ה-Inference על מספר פרומפטים במקביל (Batching)
prompts = ["Hello, my name is", "The capital of France is"]
outputs = llm.generate(prompts, sampling_params)

for output in outputs:
    print(f"Prompt: {output.prompt!r} -> Generated: {output.outputs[0].text!r}")

המעבר לעבודה עם מנועי הסקה יעילים כמו vLLM ו-TGI הוא קריטי במיוחד כאשר דנים במגמות של מודלים פתוחים מול סגורים, כפי שמתואר בפודקאסט האגדה על מלחמות המודלים: פתוח vs סגור ב-2026. בנוסף, חברות רבות מעבירות את עומסי העבודה שלהן לעננים ייעודיים (Neoclouds) כדי לחסוך בעלויות ה-GPU, נושא שעולה לדיון בפרק המיית של Mythos ו-Allbirds טוען לטיסה ל-neocloud.

הצעד הבא שלך: התקן את vLLM על שרת עם GPU (או ב-Google Colab עם כרטיס T4/A100). הרץ את השרת כ-API תואם OpenAI באמצעות הפקודה הבאה:

python -m vllm.entrypoints.openai.api_server --model facebook/opt-125m

לאחר מכן, שלח בקשת POST פשוטה באמצעות curl או ספריית openai הרשמית ובדוק את מהירות התגובה (Tokens per second) בהשוואה להרצה רגילה.

פרויקטי התחלה1 REPOS
vLLM
★ 35k
python מתקדם
הinference engine המוביל לפרודקשן — PagedAttention, continuous batching, OpenAI-compatible API.
pip install vllm && vllm serve meta-llama/Llama-3.3-70B-Instruct
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
02YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
03Vercel AI SDK · כתבה · בינוני
@ai-sdk/workflow עדכון
חברת Vercel עדכנה את ה-SDK שלה. העדכון כולל עדכונים לתלויות ושיפורים אחרים.
04YT AI Engineer · וידאו · מתקדם
אינטגרציה של סוכנים AI במערכות Event-Sourced
Divakar Kumar מציג גישה להוספת שכבת סוכנים AI למערכות קיימות. הסוכנים עובדים על אירועים ומחליטים במקרים אמביגויים. הגישה משתמשת בארכיטקטורת event-sourced קיימת, ומוסיפה שכבה סמנטית וסוכנים המתקשרים באופן א-סינכרוני.
05YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
06YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
07Vercel AI SDK · כתבה · בינוני
עדכון @ai-sdk/workflow-harness@1.0.45
חברת Vercel הוציאה עדכון לחבילת @ai-sdk/workflow-harness. העדכון כולל שיפורים באפשרויות generateObject ו-streamObject, וכן עדכונים לתלויות החבילה.
08YT AI Engineer · וידאו · מתקדם
סוכנים מלאכותיים לביצועים: משלוח מהיר, תשלום פחות
צוותו של ראג'אט שאה בנטפליקס בנה סוכן לטיפול בבעיות ביצועים. הסוכן מזהה בעיות, מציע פתרונות ומאשר אותם. הדבר מאפשר משלוח מהיר יותר ותשלום פחות.
09

Inference: vLLM / TGI

הרצה מקומית או על שרת — throughput, batching, quantization.

~4 שעותמתקדם
שיעור

כשמדובר בפריסה של מודלי שפה גדולים (LLMs) בסביבת ייצור (Production), הרצה פשוטה באמצעות ספריות כמו transformers של Hugging Face כבר אינה מספיקה. כאן נכנסים לתמונה מנועי Inference מתקדמים כמו vLLM ו-TGI (Text Generation Inference). מנועים אלו תוכננו במיוחד כדי למקסם את ה-throughput (קצב הפקת הטוקנים) ולמזער את ה-latency (זמן התגובה) על ידי אופטימיזציות ברמת החומרה והזיכרון.

מדוע אנו זקוקים להם? האתגר הגדול ביותר בהרצת LLMs הוא ניהול זיכרון ה-KV Cache (מפתח-ערך) של המודל. טכנולוגיית PagedAttention, שהוצגה לראשונה ב-vLLM, פותרת את בעיית הפרגמנטציה של הזיכרון על ידי חלוקתו לדפים דינמיים, בדומה לניהול זיכרון וירטואלי במערכות הפעלה. בנוסף, מנגנון ה-Continuous Batching (או In-flight Batching) מאפשר להכניס בקשות חדשות ל-batch הקיים בזמן אמת מבלי להמתין שכל הבקשות הקודמות יסתיימו, מה שמעלה את הניצולת של ה-GPU במאות אחוזים.

כדי להריץ מודלים ענקיים על חומרה מוגבלת, מנועים אלו תומכים בטכניקות דחיסה וקוונטיזציה (Quantization) מתקדמות כמו AWQ, GPTQ ו-FP8. שימוש בפורמטים אלו מאפשר להקטין את נפח המודל בזיכרון ה-VRAM כמעט ללא פגיעה בדיוק הכללי של המודל. בחירה בפתרון כמו vLLM מאפשרת גם חשיפה קלה של השרת כ-API התואם לחלוטין ל-OpenAI, מה שמקל על אינטגרציה מהירה עם ספריות קיימות.

הנה דוגמה קצרה ופשוטה להרצת מודל מקומי באמצעות vLLM וכתיבת קוד Python מהיר להפקת טקסט:

from vllm import LLM, SamplingParams

# טעינת המודל עם תמיכה ב-PagedAttention באופן אוטומטי
llm = LLM(model="facebook/opt-125m")

# הגדרת פרמטרים להפקה
sampling_params = SamplingParams(temperature=0.8, top_p=0.95, max_tokens=50)

# הרצת ה-Inference על מספר פרומפטים במקביל (Batching)
prompts = ["Hello, my name is", "The capital of France is"]
outputs = llm.generate(prompts, sampling_params)

for output in outputs:
    print(f"Prompt: {output.prompt!r} -> Generated: {output.outputs[0].text!r}")

המעבר לעבודה עם מנועי הסקה יעילים כמו vLLM ו-TGI הוא קריטי במיוחד כאשר דנים במגמות של מודלים פתוחים מול סגורים, כפי שמתואר בפודקאסט האגדה על מלחמות המודלים: פתוח vs סגור ב-2026. בנוסף, חברות רבות מעבירות את עומסי העבודה שלהן לעננים ייעודיים (Neoclouds) כדי לחסוך בעלויות ה-GPU, נושא שעולה לדיון בפרק המיית של Mythos ו-Allbirds טוען לטיסה ל-neocloud.

הצעד הבא שלך: התקן את vLLM על שרת עם GPU (או ב-Google Colab עם כרטיס T4/A100). הרץ את השרת כ-API תואם OpenAI באמצעות הפקודה הבאה:

python -m vllm.entrypoints.openai.api_server --model facebook/opt-125m

לאחר מכן, שלח בקשת POST פשוטה באמצעות curl או ספריית openai הרשמית ובדוק את מהירות התגובה (Tokens per second) בהשוואה להרצה רגילה.

פרויקטי התחלה1 REPOS
vLLM
★ 35k
python מתקדם
הinference engine המוביל לפרודקשן — PagedAttention, continuous batching, OpenAI-compatible API.
pip install vllm && vllm serve meta-llama/Llama-3.3-70B-Instruct
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
02YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
03Vercel AI SDK · כתבה · בינוני
@ai-sdk/workflow עדכון
חברת Vercel עדכנה את ה-SDK שלה. העדכון כולל עדכונים לתלויות ושיפורים אחרים.
04YT AI Engineer · וידאו · מתקדם
אינטגרציה של סוכנים AI במערכות Event-Sourced
Divakar Kumar מציג גישה להוספת שכבת סוכנים AI למערכות קיימות. הסוכנים עובדים על אירועים ומחליטים במקרים אמביגויים. הגישה משתמשת בארכיטקטורת event-sourced קיימת, ומוסיפה שכבה סמנטית וסוכנים המתקשרים באופן א-סינכרוני.
05YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
06YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
07Vercel AI SDK · כתבה · בינוני
עדכון @ai-sdk/workflow-harness@1.0.45
חברת Vercel הוציאה עדכון לחבילת @ai-sdk/workflow-harness. העדכון כולל שיפורים באפשרויות generateObject ו-streamObject, וכן עדכונים לתלויות החבילה.
08YT AI Engineer · וידאו · מתקדם
סוכנים מלאכותיים לביצועים: משלוח מהיר, תשלום פחות
צוותו של ראג'אט שאה בנטפליקס בנה סוכן לטיפול בבעיות ביצועים. הסוכן מזהה בעיות, מציע פתרונות ומאשר אותם. הדבר מאפשר משלוח מהיר יותר ותשלום פחות.
10

Leaderboards + benchmarks

LMArena, Open LLM Leaderboard, ArtificialAnalysis.

~2 שעותבינוני
שיעור

בעולם ה-AI המתפתח במהירות מסחררת, בחירת מודל השפה (LLM) המתאים ביותר למשימה שלכם היא אתגר מורכב. כאן נכנסים לתמונה לוחות מובילים (Leaderboards) ומבחני ביצועים (Benchmarks). כלים אלו מספקים מדדים אובייקטיביים והשוואתיים בין עשרות ומאות מודלים שונים. שלושת הכלים המובילים כיום בתחום הם LMSYS Chatbot Arena (LMArena) המבוסס על דירוג אנושי עיוור (Elo rating), ה-Open LLM Leaderboard של Hugging Face המתמקד במבחנים אקדמיים פתוחים, ו-ArtificialAnalysis המספק ניתוח מעמיק של מהירות, עלות וביצועים בזמן אמת.

הבנת הכלים הללו קריטית עבור מפתחים וארכיטקטים של פתרונות AI. במקום להסתמך על הבטחות שיווקיות של חברות הענק, מדדים אלו מאפשרים לכם לקבל החלטות מבוססות נתונים. לדוגמה, אם האפליקציה שלכם דורשת זמני תגובה מהירים במיוחד (Latency נמוך) ועלויות נמוכות, תרצו לבדוק את הנתונים ב-ArtificialAnalysis. לעומת זאת, אם אתם מחפשים מודל שמבין ניואנסים אנושיים בצורה הטובה ביותר, הדירוג ב-LMArena הוא המקור המהימן ביותר כיוון שהוא מבוסס על אלפי השוואות "ראש בראש" של משתמשים אמיתיים.

מעבר להסתמכות על לוחות ציבוריים, לעיתים קרובות תרצו להריץ מבחני ביצועים (benchmarks) מותאמים אישית על המודלים שלכם או על משימות ספציפיות לארגון שלכם. הכלי המוביל בתעשייה למטרה זו הוא lm-evaluation-harness של EleutherAI. כלי זה מאפשר להריץ מאות מבחנים סטנדרטיים (כמו MMLU, GSM8k ועוד) על כל מודל מקומי או מרוחק בצורה פשוטה ומהירה, ובכך לייצר "לוח מובילים" פנימי משלכם.

כדי להתחיל להשתמש ב-lm-evaluation-harness באופן מקומי, ניתן להריץ פקודה פשוטה מהטרמינל כדי להעריך מודל (למשל מודל של Hugging Face) על משימה ספציפית:

# התקנת הכלי
pip install lm-eval

# הרצת הערכה למודל Llama-3 על משימת MMLU
lm_eval --model hf \
    --model_args pretrained=meta-llama/Meta-Llama-3-8B \
    --tasks mmlu \
    --device cuda:0 \
    --batch_size 8

כאשר בונים מערכות AI מורכבות, כלי הערכה משתלבים ישירות בתוך ספריות הפיתוח. לדוגמה, בגרסאות האחרונות של DSPy 3.2.0 ו-DSPy 3.1.0, מושם דגש רב על אופטימיזציה והערכה אוטומטית של פרומפטים ומודלים (Assertions & Suggestions). שילוב של ספריות אלו יחד עם מתודולוגיות הערכה מובנות מאפשר לשפר את דיוק המודל בצורה שיטתית ומדידה, בדומה לתהליכי בדיקות תוכנה מסורתיים (CI/CD).

הצעד הבא שלכם: התקינו את פרויקט הקוד lm-evaluation-harness והריצו הערכה בסיסית על מודל קטן ופתוח (כמו Qwen/Qwen2.5-1.5B-Instruct) באמצעות משימת הערכה פשוטה כמו arc_challenge או hellaswag. השוו את התוצאות שקיבלתם לדירוג הרשמי ב-Open LLM Leaderboard כדי להבין כיצד המדדים מתנהגים בפועל.

פרויקטי התחלה1 REPOS
lm-evaluation-harness
★ 8k
python מתקדם
הכלי שעומד מאחורי Open LLM Leaderboard. הרץ benchmarks משלך.
pip install lm-eval && lm_eval --tasks hellaswag
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
02YT AI Engineer · וידאו · מתקדם
SimulationMaxxing: Nubank משלים 20× מהר עם סימולציות
Nubank משרתת 135 מיליון לקוחות. סימולציות מאפשרות לחברה לבדוק ולשפר סוכנים במהירות. הרצאה על הנושא מציגה את התוצאות: 5 סוכנים בייצור, שביעות רצון לקוחות גבוהה יותר, וזמן אספקה מהיר פי 20. הסימולציות מחקות שיחות לקוחות ומאפשרות לצוות לבדוק ולשפר את הסוכנים.
03YT AI Engineer · וידאו · מתקדם
בניית מוצרים סביב יכולות
יכולות הן מאפיינים חדשים. יוג'נדרה מיראג'ה מ-FactSet מדבר על בניית מוצרים סביב יכולות. הוא מסביר כיצד ליצור רישום יכולות מינימלי, על החשיבות של בדיקות ואיך לנהל יכולות בקנה מידה גדול.
04YT AI Engineer · וידאו · מתקדם
ALPHALAB של Morgan Stanley: מחקר רב-סוכנים
ALPHALAB הוא מערכת רב-סוכנים שפיתחה Morgan Stanley. המערכת מקבלת בעיה בשפה טבעית, כותבת קוד, מבצעת בדיקות ואופטימיזציה. היא כוללת סוכנים אסטרטגיים וסוכנים עובדים, ומאפשרת עריכה ואישור לפני ביצוע.
05YT AI Engineer · וידאו · בינוני
הנדסת Forward Deployed ב-Ramp
חברת Ramp משתמשת בהנדסת Forward Deployed כדי לספק שירותים ללקוחותיה. החברה משלבת אלמנטים של בינה מלאכותית, כגון סוכנים, כדי לעמוד בדרישות הלקוחות. היא מדגישה את חשיבות הסקירה וההערכה של הבקשות.
06YT AI Engineer · וידאו · מתקדם
DeepSWE: בנצ'מרק לקידוד עמיד בזיהום
DeepSWE הוא בנצ'מרק לקידוד עמיד בזיהום, הכולל 113 משימות קידוד שנכתבו מאפס. הבנצ'מרק מודד את היכולת של מודלים כמו GPT ו-Claude לבצע משימות קידוד מורכבות.
07YT AI Engineer · וידאו · מתקדם
סוכנו שלא נכשל, אלא החיבור שלו
וינות גובינדראג'ן מדבר על כישלונות מערכת בסוכנים, לא כישלונות מודל. הוא מציג את OpenClaw כמקרה מבחן, ומדגים את הבעיות שעלולות לקרות כאשר הסוכן משתמש במצב ישן, או כאשר ישנם כותבים חופפים. הוא מציע שיטה לבדיקת קבלות לסוכנים, עם חמישה שאלות לכל אירוע.
08YT AI Engineer · וידאו · מתקדם
פיתוח מונחה Evals למאמן בריאות הנפש AI
צוות SonderMind פיתח מאמן בריאות הנפש AI עם מנגנון Evals-Driven Development. המערכת כוללת לולאת משוב קליני, מנוע אתיקה וארכיטקטורת Supervisor/Executor/Evaluator.
11

Leaderboards + benchmarks

LMArena, Open LLM Leaderboard, ArtificialAnalysis.

~2 שעותבינוני
שיעור

בעולם ה-AI המתפתח במהירות מסחררת, בחירת מודל השפה (LLM) המתאים ביותר למשימה שלכם היא אתגר מורכב. כאן נכנסים לתמונה לוחות מובילים (Leaderboards) ומבחני ביצועים (Benchmarks). כלים אלו מספקים מדדים אובייקטיביים והשוואתיים בין עשרות ומאות מודלים שונים. שלושת הכלים המובילים כיום בתחום הם LMSYS Chatbot Arena (LMArena) המבוסס על דירוג אנושי עיוור (Elo rating), ה-Open LLM Leaderboard של Hugging Face המתמקד במבחנים אקדמיים פתוחים, ו-ArtificialAnalysis המספק ניתוח מעמיק של מהירות, עלות וביצועים בזמן אמת.

הבנת הכלים הללו קריטית עבור מפתחים וארכיטקטים של פתרונות AI. במקום להסתמך על הבטחות שיווקיות של חברות הענק, מדדים אלו מאפשרים לכם לקבל החלטות מבוססות נתונים. לדוגמה, אם האפליקציה שלכם דורשת זמני תגובה מהירים במיוחד (Latency נמוך) ועלויות נמוכות, תרצו לבדוק את הנתונים ב-ArtificialAnalysis. לעומת זאת, אם אתם מחפשים מודל שמבין ניואנסים אנושיים בצורה הטובה ביותר, הדירוג ב-LMArena הוא המקור המהימן ביותר כיוון שהוא מבוסס על אלפי השוואות "ראש בראש" של משתמשים אמיתיים.

מעבר להסתמכות על לוחות ציבוריים, לעיתים קרובות תרצו להריץ מבחני ביצועים (benchmarks) מותאמים אישית על המודלים שלכם או על משימות ספציפיות לארגון שלכם. הכלי המוביל בתעשייה למטרה זו הוא lm-evaluation-harness של EleutherAI. כלי זה מאפשר להריץ מאות מבחנים סטנדרטיים (כמו MMLU, GSM8k ועוד) על כל מודל מקומי או מרוחק בצורה פשוטה ומהירה, ובכך לייצר "לוח מובילים" פנימי משלכם.

כדי להתחיל להשתמש ב-lm-evaluation-harness באופן מקומי, ניתן להריץ פקודה פשוטה מהטרמינל כדי להעריך מודל (למשל מודל של Hugging Face) על משימה ספציפית:

# התקנת הכלי
pip install lm-eval

# הרצת הערכה למודל Llama-3 על משימת MMLU
lm_eval --model hf \
    --model_args pretrained=meta-llama/Meta-Llama-3-8B \
    --tasks mmlu \
    --device cuda:0 \
    --batch_size 8

כאשר בונים מערכות AI מורכבות, כלי הערכה משתלבים ישירות בתוך ספריות הפיתוח. לדוגמה, בגרסאות האחרונות של DSPy 3.2.0 ו-DSPy 3.1.0, מושם דגש רב על אופטימיזציה והערכה אוטומטית של פרומפטים ומודלים (Assertions & Suggestions). שילוב של ספריות אלו יחד עם מתודולוגיות הערכה מובנות מאפשר לשפר את דיוק המודל בצורה שיטתית ומדידה, בדומה לתהליכי בדיקות תוכנה מסורתיים (CI/CD).

הצעד הבא שלכם: התקינו את פרויקט הקוד lm-evaluation-harness והריצו הערכה בסיסית על מודל קטן ופתוח (כמו Qwen/Qwen2.5-1.5B-Instruct) באמצעות משימת הערכה פשוטה כמו arc_challenge או hellaswag. השוו את התוצאות שקיבלתם לדירוג הרשמי ב-Open LLM Leaderboard כדי להבין כיצד המדדים מתנהגים בפועל.

פרויקטי התחלה1 REPOS
lm-evaluation-harness
★ 8k
python מתקדם
הכלי שעומד מאחורי Open LLM Leaderboard. הרץ benchmarks משלך.
pip install lm-eval && lm_eval --tasks hellaswag
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
02YT AI Engineer · וידאו · מתקדם
SimulationMaxxing: Nubank משלים 20× מהר עם סימולציות
Nubank משרתת 135 מיליון לקוחות. סימולציות מאפשרות לחברה לבדוק ולשפר סוכנים במהירות. הרצאה על הנושא מציגה את התוצאות: 5 סוכנים בייצור, שביעות רצון לקוחות גבוהה יותר, וזמן אספקה מהיר פי 20. הסימולציות מחקות שיחות לקוחות ומאפשרות לצוות לבדוק ולשפר את הסוכנים.
03YT AI Engineer · וידאו · מתקדם
בניית מוצרים סביב יכולות
יכולות הן מאפיינים חדשים. יוג'נדרה מיראג'ה מ-FactSet מדבר על בניית מוצרים סביב יכולות. הוא מסביר כיצד ליצור רישום יכולות מינימלי, על החשיבות של בדיקות ואיך לנהל יכולות בקנה מידה גדול.
04YT AI Engineer · וידאו · מתקדם
ALPHALAB של Morgan Stanley: מחקר רב-סוכנים
ALPHALAB הוא מערכת רב-סוכנים שפיתחה Morgan Stanley. המערכת מקבלת בעיה בשפה טבעית, כותבת קוד, מבצעת בדיקות ואופטימיזציה. היא כוללת סוכנים אסטרטגיים וסוכנים עובדים, ומאפשרת עריכה ואישור לפני ביצוע.
05YT AI Engineer · וידאו · בינוני
הנדסת Forward Deployed ב-Ramp
חברת Ramp משתמשת בהנדסת Forward Deployed כדי לספק שירותים ללקוחותיה. החברה משלבת אלמנטים של בינה מלאכותית, כגון סוכנים, כדי לעמוד בדרישות הלקוחות. היא מדגישה את חשיבות הסקירה וההערכה של הבקשות.
06YT AI Engineer · וידאו · מתקדם
DeepSWE: בנצ'מרק לקידוד עמיד בזיהום
DeepSWE הוא בנצ'מרק לקידוד עמיד בזיהום, הכולל 113 משימות קידוד שנכתבו מאפס. הבנצ'מרק מודד את היכולת של מודלים כמו GPT ו-Claude לבצע משימות קידוד מורכבות.
07YT AI Engineer · וידאו · מתקדם
סוכנו שלא נכשל, אלא החיבור שלו
וינות גובינדראג'ן מדבר על כישלונות מערכת בסוכנים, לא כישלונות מודל. הוא מציג את OpenClaw כמקרה מבחן, ומדגים את הבעיות שעלולות לקרות כאשר הסוכן משתמש במצב ישן, או כאשר ישנם כותבים חופפים. הוא מציע שיטה לבדיקת קבלות לסוכנים, עם חמישה שאלות לכל אירוע.
08YT AI Engineer · וידאו · מתקדם
פיתוח מונחה Evals למאמן בריאות הנפש AI
צוות SonderMind פיתח מאמן בריאות הנפש AI עם מנגנון Evals-Driven Development. המערכת כוללת לולאת משוב קליני, מנוע אתיקה וארכיטקטורת Supervisor/Executor/Evaluator.
12

מודלים רב-מודאליים open-source

Llama Vision, Qwen-VL, PaliGemma — איך מודלי שפה רואים תמונות, וידאו, אודיו.

~4 שעותמתקדם
שיעור

בעולם ה-AI המודרני, מודלים של שפה כבר אינם מוגבלים לטקסט בלבד. מודלים רב-מודאליים (Multimodal Models) בקוד פתוח, כדוגמת Llama 3.2 Vision, Qwen-VL ו-PaliGemma, חוללו מהפכה בכך שהם מאפשרים ל-LLM "לראות" תמונות ווידאו, ואף להבין אודיו באותה רשת נוירונים. פריצת הדרך הזו מתאפשרת על ידי חיבור של Vision Encoder (כמו CLIP או SigLIP) ישירות אל ה-Backbone של מודל השפה באמצעות שכבת קישור (Projection Layer) המתרגמת את הפיצ'רים הוויזואליים לטוקנים שהמודל מסוגל לעבד.

המעבר למודלים רב-מודאליים בקוד פתוח (Open-Source) הוא קריטי עבור ארגונים ומפתחים המעוניינים בפרטיות מידע מלאה, התאמה אישית (Fine-tuning) על דאטה ייחודי, ומניעת עלויות API גבוהות של מודלים סגורים. שימוש במודלים אלו נפוץ במיוחד במערכות RAG מתקדמות המשלבות מסמכים סרוקים, ניתוח אוטומטי של תרשימים רפואיים, פענוח קבלות (OCR מתקדם), ואפילו ניתוח בזמן אמת של מצלמות אבטחה ווידאו.

כדי לבנות יישומים מורכבים המשלבים ראייה ממוחשבת ושפה, אנו נעזרים בפריימוורקים מובילים לניהול קונטקסט. עדכונים אחרונים כמו LlamaIndex v0.14.15 וכן llama-index-core 0.14.16 מציגים שיפורים משמעותיים בתמיכה במודלי Vision, המאפשרים שליפת מידע מדויקת מתוך תמונות ומסמכים מרובי עמודים (Multi-modal RAG).

להלן דוגמה קונקרטית לטעינה והרצה של מודל Qwen-VL לניתוח תמונה באמצעות ספריית transformers של Hugging Face:

from transformers import Qwen2VLForConditionalGeneration, AutoProcessor
from PIL import Image

# טעינת המודל והמעבד המתאים
model = Qwen2VLForConditionalGeneration.from_pretrained("Qwen/Qwen2-VL-7B-Instruct", torch_dtype="auto", device_map="auto")
processor = AutoProcessor.from_pretrained("Qwen/Qwen2-VL-7B-Instruct")

image = Image.open("invoice.jpg")
messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "Extract the total amount and tax from this invoice."}]}]
text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = processor(text=[text], images=[image], padding=True, return_tensors="pt").to("cuda")

generated_ids = model.generate(**inputs, max_new_tokens=128)
print(processor.batch_decode(generated_ids, skip_special_tokens=True))

מעבר לניתוח טכני יבש, השילוב של יכולות ראייה פותח אפיקים חדשים של יצירתיות ופיתוח ממשקים אינטראקטיביים. כפי שמתואר במאמר על הגברת יצירתיות בעידן ה-AI מבית MIT Tech Review, השילוב של קלט ויזואלי מאפשר ליוצרים ומפתחים לעבוד בצורה אינטואיטיבית יותר, שבה המודל מבין סקיצות ידניות, עיצובי ממשק משתמש (UI) או תרשימי זרימה והופך אותם לקוד פרודקשן או ליצירות אמנות חדשות.

הצעד הבא שלכם: פרויקט הסטארטר המומלץ ביותר להתחלה הוא שימוש ב- LLaVA או ב- Qwen-VL. הורידו את אחד המודלים הללו באופן מקומי (למשל באמצעות Ollama או Hugging Face), והקימו יישום קטן שמקבל קובץ PDF סרוק ומפיק ממנו קובץ JSON מובנה המכיל את כל הנתונים החשובים מתוך הטבלאות והגרפים שבו.

פרויקטי התחלה2 REPOS
LLaVA
★ 21k
python מתקדם
מודל ה-vision-language open-source הראשון שהיה תחרותי מול GPT-4V. ארכיטקטורה ברורה, קל לאימון.
git clone https://github.com/haotian-liu/LLaVA && pip install -e .
GitHub ↗
Qwen-VL
★ 5.5k
python מתקדם
משפחת המודלים הוויזואליים של Alibaba — מובילה ב-benchmarks. תומכת תמונות, וידאו, OCR.
pip install transformers accelerate
GitHub ↗
חומרי קריאה8 פריטים
01MIT Tech Review AI · כתבה · מתקדם
הדרך לעל-אינטליגנציה מלאכותית
מערכת בריאות המורכבת מסוכנים רבים, כל אחד מומחה בתחומו. הם יכולים להחליף נתונים, אך עדיין לא מסוגלים לתאם טיפול רפואי ללא החלטות אנושיות. תוספת שכבה סמנטית, 'אינטרנט של קוגניציה', מאפשרת לסוכנים לעבוד ול'חשוב' יחד.
02YT AI Engineer · וידאו · מתקדם
מציאות מסובכת של קנה מידה: נתונים סינתטיים ופרה-אימון
חברת poolside מפתחת נתונים סינתטיים ופרה-אימון לקודים אגנטיים. החברה משתמשת בצינור מרובשבבות ליצירת נתונים סינתטיים, ומאמנת מודלים עם 118 מיליארד פרמטרים. התוצאות הראשוניות מראות עליונות על מודל GLM 4.5 Air.
03YT AI Engineer · וידאו · מתקדם
בניית אימון סגור לסוכנות רב-מודאלית בקנה מידה
חברת Uber פיתחה שיטה לבניית אימון סגור עבור סוכנות רב-מודאלית. המערכת משפרת צילומי מזון עבור סוחרים עצמאיים באמצעות שילוב אותונומי וידאו. החידוש כולל שיטות למניעת הונאה ובניית משוב סגור.
04YT AI Engineer · וידאו · מתקדם
סוכנים רב-עכבר: פריצת דרך בשימוש במחשב
צוות פיתח כלי בשם Cua Driver, המאפשר לסוכנים רבים לפעול על מחשב בו-זמנית. הכלי משתמש ב-APIs של המערכת ההפעלה כדי לאפשר לסוכנים לפעול על חלונות רקע. נבדקו 130 משימות שונות על 5 פלטפורמות.
05MarkTechPost · כתבה · מתקדם
בניית מערכת VideoAgent-Style: פירוש כוונה, תכנון גרף וניתוב כלים
מערכת VideoAgent-Style מאפשרת עריכת וידאו באמצעות פקודות בשפה טבעית. המערכת משתמשת בפירוש כוונה, תכנון גרף וניתוב כלים כדי ליצור תוצרים וידאו מותאמים. המערכת כוללת כלים כמו FFmpeg, Whisper ו-PIL.
06MarkTechPost · כתבה · מתקדם
מעבדות Thinking Machines מציגות תיקון טכני לבניית AI מרוכזת אדם
חוקרים במעבדות Thinking Machines פרסמו דו״ח המציע בניית AI המותאמת לצורכי בני אדם. הדו״ח טוען כי רוב ה-AI הנמצא בשימוש היום מאומן במקומות ספורים ואז ננעל. החוקרים רוצים AI שהוא מבוזר, מותאם אישית ומעוצב על ידי משתמשיו.
07MarkTechPost · כתבה · מתקדם
מדריך NVIDIA ל-Cosmos-Framework: יישום מיניאטורי של Cosmos 3
NVIDIA השיקה מדריך ל-Cosmos-Framework, המראה כיצד ליישם מודל עולם מיניאטורי עם Omnimodal Mixture-of-Transformers. המדריך מתמקד בחומרה של Colab ובאיך להתגבר על מגבלות החומרה.
08YT IndyDevDan · וידאו · מתקדם
CMUX פותר את בעיית התזמון של סוכנים מרובים
CMUX פותר את בעיית התזמון של סוכנים מרובים. הוא מאפשר גישה אגנטית לסוכנים ומאפשר להם לעבוד במקביל. הדבר מאפשר להגדיל את היעילות ולפתור בעיות מורכבות.
13

מודלים רב-מודאליים open-source

Llama Vision, Qwen-VL, PaliGemma — איך מודלי שפה רואים תמונות, וידאו, אודיו.

~4 שעותמתקדם
שיעור

בעולם ה-AI המודרני, מודלים של שפה כבר אינם מוגבלים לטקסט בלבד. מודלים רב-מודאליים (Multimodal Models) בקוד פתוח, כדוגמת Llama 3.2 Vision, Qwen-VL ו-PaliGemma, חוללו מהפכה בכך שהם מאפשרים ל-LLM "לראות" תמונות ווידאו, ואף להבין אודיו באותה רשת נוירונים. פריצת הדרך הזו מתאפשרת על ידי חיבור של Vision Encoder (כמו CLIP או SigLIP) ישירות אל ה-Backbone של מודל השפה באמצעות שכבת קישור (Projection Layer) המתרגמת את הפיצ'רים הוויזואליים לטוקנים שהמודל מסוגל לעבד.

המעבר למודלים רב-מודאליים בקוד פתוח (Open-Source) הוא קריטי עבור ארגונים ומפתחים המעוניינים בפרטיות מידע מלאה, התאמה אישית (Fine-tuning) על דאטה ייחודי, ומניעת עלויות API גבוהות של מודלים סגורים. שימוש במודלים אלו נפוץ במיוחד במערכות RAG מתקדמות המשלבות מסמכים סרוקים, ניתוח אוטומטי של תרשימים רפואיים, פענוח קבלות (OCR מתקדם), ואפילו ניתוח בזמן אמת של מצלמות אבטחה ווידאו.

כדי לבנות יישומים מורכבים המשלבים ראייה ממוחשבת ושפה, אנו נעזרים בפריימוורקים מובילים לניהול קונטקסט. עדכונים אחרונים כמו LlamaIndex v0.14.15 וכן llama-index-core 0.14.16 מציגים שיפורים משמעותיים בתמיכה במודלי Vision, המאפשרים שליפת מידע מדויקת מתוך תמונות ומסמכים מרובי עמודים (Multi-modal RAG).

להלן דוגמה קונקרטית לטעינה והרצה של מודל Qwen-VL לניתוח תמונה באמצעות ספריית transformers של Hugging Face:

from transformers import Qwen2VLForConditionalGeneration, AutoProcessor
from PIL import Image

# טעינת המודל והמעבד המתאים
model = Qwen2VLForConditionalGeneration.from_pretrained("Qwen/Qwen2-VL-7B-Instruct", torch_dtype="auto", device_map="auto")
processor = AutoProcessor.from_pretrained("Qwen/Qwen2-VL-7B-Instruct")

image = Image.open("invoice.jpg")
messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "Extract the total amount and tax from this invoice."}]}]
text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = processor(text=[text], images=[image], padding=True, return_tensors="pt").to("cuda")

generated_ids = model.generate(**inputs, max_new_tokens=128)
print(processor.batch_decode(generated_ids, skip_special_tokens=True))

מעבר לניתוח טכני יבש, השילוב של יכולות ראייה פותח אפיקים חדשים של יצירתיות ופיתוח ממשקים אינטראקטיביים. כפי שמתואר במאמר על הגברת יצירתיות בעידן ה-AI מבית MIT Tech Review, השילוב של קלט ויזואלי מאפשר ליוצרים ומפתחים לעבוד בצורה אינטואיטיבית יותר, שבה המודל מבין סקיצות ידניות, עיצובי ממשק משתמש (UI) או תרשימי זרימה והופך אותם לקוד פרודקשן או ליצירות אמנות חדשות.

הצעד הבא שלכם: פרויקט הסטארטר המומלץ ביותר להתחלה הוא שימוש ב- LLaVA או ב- Qwen-VL. הורידו את אחד המודלים הללו באופן מקומי (למשל באמצעות Ollama או Hugging Face), והקימו יישום קטן שמקבל קובץ PDF סרוק ומפיק ממנו קובץ JSON מובנה המכיל את כל הנתונים החשובים מתוך הטבלאות והגרפים שבו.

פרויקטי התחלה2 REPOS
LLaVA
★ 21k
python מתקדם
מודל ה-vision-language open-source הראשון שהיה תחרותי מול GPT-4V. ארכיטקטורה ברורה, קל לאימון.
git clone https://github.com/haotian-liu/LLaVA && pip install -e .
GitHub ↗
Qwen-VL
★ 5.5k
python מתקדם
משפחת המודלים הוויזואליים של Alibaba — מובילה ב-benchmarks. תומכת תמונות, וידאו, OCR.
pip install transformers accelerate
GitHub ↗
חומרי קריאה8 פריטים
01MIT Tech Review AI · כתבה · מתקדם
הדרך לעל-אינטליגנציה מלאכותית
מערכת בריאות המורכבת מסוכנים רבים, כל אחד מומחה בתחומו. הם יכולים להחליף נתונים, אך עדיין לא מסוגלים לתאם טיפול רפואי ללא החלטות אנושיות. תוספת שכבה סמנטית, 'אינטרנט של קוגניציה', מאפשרת לסוכנים לעבוד ול'חשוב' יחד.
02YT AI Engineer · וידאו · מתקדם
מציאות מסובכת של קנה מידה: נתונים סינתטיים ופרה-אימון
חברת poolside מפתחת נתונים סינתטיים ופרה-אימון לקודים אגנטיים. החברה משתמשת בצינור מרובשבבות ליצירת נתונים סינתטיים, ומאמנת מודלים עם 118 מיליארד פרמטרים. התוצאות הראשוניות מראות עליונות על מודל GLM 4.5 Air.
03YT AI Engineer · וידאו · מתקדם
בניית אימון סגור לסוכנות רב-מודאלית בקנה מידה
חברת Uber פיתחה שיטה לבניית אימון סגור עבור סוכנות רב-מודאלית. המערכת משפרת צילומי מזון עבור סוחרים עצמאיים באמצעות שילוב אותונומי וידאו. החידוש כולל שיטות למניעת הונאה ובניית משוב סגור.
04YT AI Engineer · וידאו · מתקדם
סוכנים רב-עכבר: פריצת דרך בשימוש במחשב
צוות פיתח כלי בשם Cua Driver, המאפשר לסוכנים רבים לפעול על מחשב בו-זמנית. הכלי משתמש ב-APIs של המערכת ההפעלה כדי לאפשר לסוכנים לפעול על חלונות רקע. נבדקו 130 משימות שונות על 5 פלטפורמות.
05MarkTechPost · כתבה · מתקדם
בניית מערכת VideoAgent-Style: פירוש כוונה, תכנון גרף וניתוב כלים
מערכת VideoAgent-Style מאפשרת עריכת וידאו באמצעות פקודות בשפה טבעית. המערכת משתמשת בפירוש כוונה, תכנון גרף וניתוב כלים כדי ליצור תוצרים וידאו מותאמים. המערכת כוללת כלים כמו FFmpeg, Whisper ו-PIL.
06MarkTechPost · כתבה · מתקדם
מעבדות Thinking Machines מציגות תיקון טכני לבניית AI מרוכזת אדם
חוקרים במעבדות Thinking Machines פרסמו דו״ח המציע בניית AI המותאמת לצורכי בני אדם. הדו״ח טוען כי רוב ה-AI הנמצא בשימוש היום מאומן במקומות ספורים ואז ננעל. החוקרים רוצים AI שהוא מבוזר, מותאם אישית ומעוצב על ידי משתמשיו.
07MarkTechPost · כתבה · מתקדם
מדריך NVIDIA ל-Cosmos-Framework: יישום מיניאטורי של Cosmos 3
NVIDIA השיקה מדריך ל-Cosmos-Framework, המראה כיצד ליישם מודל עולם מיניאטורי עם Omnimodal Mixture-of-Transformers. המדריך מתמקד בחומרה של Colab ובאיך להתגבר על מגבלות החומרה.
08YT IndyDevDan · וידאו · מתקדם
CMUX פותר את בעיית התזמון של סוכנים מרובים
CMUX פותר את בעיית התזמון של סוכנים מרובים. הוא מאפשר גישה אגנטית לסוכנים ומאפשר להם לעבוד במקביל. הדבר מאפשר להגדיל את היעילות ולפתור בעיות מורכבות.
14

Quantization: GGUF, AWQ, GPTQ

איך מריצים מודל 70B על לאפטופ. השוואת שיטות quantization וההשפעה על איכות.

~3 שעותמתקדם
שיעור

להריץ מודל שפה ענק של 70 מיליארד פרמטרים (70B) על מחשב נייד אישי נשמע בעבר כמו מדע בדיוני. מודל כזה בפורמט FP16 (דיוק של 16-bit) דורש מעל 140GB של זיכרון VRAM/RAM רק כדי להיטען. כאן נכנסת לתמונה טכנולוגיית ה-Quantization (כימות), המאפשרת לדחוס את משקולות המודל ל-4-bit או 8-bit, ובכך להפחית את דרישות הזיכרון בכ-75% תוך שמירה על ביצועים קרובים מאוד למקור. פריצת הדרך הזו מאפשרת להריץ מודלים מקומיים חזקים ישירות על חומרת קצה, כפי שמתואר בדיון על יצירת עוזר AI פרטי ב-Thunderbird.

הפורמט הפופולרי ביותר להרצה מקומית על מעבדים (CPU) ומעבדי Apple Silicon הוא GGUF, שפותח כחלק מפרויקט llama.cpp. GGUF מותאם במיוחד להרצה יעילה תוך שיתוף זיכרון בין ה-CPU ל-GPU (במיוחד ב-MacBook עם Unified Memory). הוא תומך בטכניקות כימות מתקדמות (כמו k-quants) המאפשרות להריץ מודל 70B בכימות של 4-bit (הדורש כ-40GB RAM בלבד) במהירות סבירה לחלוטין לשימוש יומיומי.

עבור שרתי GPU ומשימות הדורשות מהירות הפקה (throughput) גבוהה, אנו משתמשים בפורמטים כמו GPTQ ו-AWQ. בעוד ש-GPTQ מבצע כימות סטטי המבוסס על כיול חד-פעמי, שיטת AWQ (Activation-aware Weight Quantization), הנתמכת על ידי ספריות כמו AutoAWQ, מגינה על משקולות קריטיות ("salient weights") שמושפעות ביותר בזמן ה-activation. גישה זו שומרת על דיוק גבוה משמעותית בכימות של 4-bit, ומאפשרת אינטגרציה חלקה עם מנועי הרצה מהירים כמו vLLM ו-Hugging Face.

הבחירה בין השיטות תלויה בחומרה ובשימוש: GGUF הוא המלך הבלתי מעורער של הרצה מקומית על מחשבים ניידים ומעבדים משולבים. AWQ ו-GPTQ מיועדים ל-GPUs ייעודיים (כמו כרטיסי Nvidia RTX) ומספקים מהירות הפקה גבוהה בהרבה בסביבות פרודקשן. הירידה באיכות (Perplexity) במעבר ל-4-bit היא מינורית ביותר ברוב המשימות, מה שהופך את הוויתור על הדיוק המלא למשתלם במיוחד במאבק בין האגדה על מלחמות המודלים: פתוח vs סגור ב-2026.

להלן דוגמה פשוטה להרצת מודל Llama 3 8B בפורמט GGUF מקומית באמצעות Python וספריית llama-cpp-python:

from llama_cpp import Llama

# טעינת מודל GGUF שעבר כימות ל-4-bit
llm = Llama(
    model_path="./llama-3-8b-Instruct-Q4_K_M.gguf",
    n_ctx=2048,  # אורך ההקשר
    n_threads=8  # מספר ליבות ה-CPU לשימוש
)

# הרצת פרומפט
output = llm("Q: What is the benefit of AWQ over GPTQ? A:", max_tokens=100)
print(output["choices"][0]["text"])

הצעד הבא שלכם: הורידו את כלי ה-CLI של llama.cpp, הורידו מודל Llama 3 8B בפורמט GGUF (למשל גרסת Q4_K_M מ-Hugging Face), והריצו אותו מקומית דרך הטרמינל שלכם. זו הדרך המהירה ביותר להבין את העוצמה של מודלים מכומתים על המחשב האישי שלכם.

פרויקטי התחלה2 REPOS
llama.cpp + GGUF
★ 70k
cpp מתקדם
הפורמט הסטנדרטי לקבצי quantized. 4-bit לרוב, 8-bit ליעדים גבוהים. הריצו 70B על MacBook.
huggingface-cli download bartowski/Meta-Llama-3.3-70B-Instruct-GGUF Q4_K_M.gguf
GitHub ↗
AutoAWQ
★ 2.2k
python מתקדם
Activation-aware Weight Quantization — איכות גבוהה ב-4-bit. אינטגרציה עם vLLM/HF.
pip install autoawq
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
02YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
03Vercel AI SDK · כתבה · בינוני
@ai-sdk/workflow עדכון
חברת Vercel עדכנה את ה-SDK שלה. העדכון כולל עדכונים לתלויות ושיפורים אחרים.
04YT AI Engineer · וידאו · מתקדם
אינטגרציה של סוכנים AI במערכות Event-Sourced
Divakar Kumar מציג גישה להוספת שכבת סוכנים AI למערכות קיימות. הסוכנים עובדים על אירועים ומחליטים במקרים אמביגויים. הגישה משתמשת בארכיטקטורת event-sourced קיימת, ומוסיפה שכבה סמנטית וסוכנים המתקשרים באופן א-סינכרוני.
05YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
06YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
07Vercel AI SDK · כתבה · בינוני
עדכון @ai-sdk/workflow-harness@1.0.45
חברת Vercel הוציאה עדכון לחבילת @ai-sdk/workflow-harness. העדכון כולל שיפורים באפשרויות generateObject ו-streamObject, וכן עדכונים לתלויות החבילה.
08YT AI Engineer · וידאו · מתקדם
סוכנים מלאכותיים לביצועים: משלוח מהיר, תשלום פחות
צוותו של ראג'אט שאה בנטפליקס בנה סוכן לטיפול בבעיות ביצועים. הסוכן מזהה בעיות, מציע פתרונות ומאשר אותם. הדבר מאפשר משלוח מהיר יותר ותשלום פחות.
15

Quantization: GGUF, AWQ, GPTQ

איך מריצים מודל 70B על לאפטופ. השוואת שיטות quantization וההשפעה על איכות.

~3 שעותמתקדם
שיעור

להריץ מודל שפה ענק של 70 מיליארד פרמטרים (70B) על מחשב נייד אישי נשמע בעבר כמו מדע בדיוני. מודל כזה בפורמט FP16 (דיוק של 16-bit) דורש מעל 140GB של זיכרון VRAM/RAM רק כדי להיטען. כאן נכנסת לתמונה טכנולוגיית ה-Quantization (כימות), המאפשרת לדחוס את משקולות המודל ל-4-bit או 8-bit, ובכך להפחית את דרישות הזיכרון בכ-75% תוך שמירה על ביצועים קרובים מאוד למקור. פריצת הדרך הזו מאפשרת להריץ מודלים מקומיים חזקים ישירות על חומרת קצה, כפי שמתואר בדיון על יצירת עוזר AI פרטי ב-Thunderbird.

הפורמט הפופולרי ביותר להרצה מקומית על מעבדים (CPU) ומעבדי Apple Silicon הוא GGUF, שפותח כחלק מפרויקט llama.cpp. GGUF מותאם במיוחד להרצה יעילה תוך שיתוף זיכרון בין ה-CPU ל-GPU (במיוחד ב-MacBook עם Unified Memory). הוא תומך בטכניקות כימות מתקדמות (כמו k-quants) המאפשרות להריץ מודל 70B בכימות של 4-bit (הדורש כ-40GB RAM בלבד) במהירות סבירה לחלוטין לשימוש יומיומי.

עבור שרתי GPU ומשימות הדורשות מהירות הפקה (throughput) גבוהה, אנו משתמשים בפורמטים כמו GPTQ ו-AWQ. בעוד ש-GPTQ מבצע כימות סטטי המבוסס על כיול חד-פעמי, שיטת AWQ (Activation-aware Weight Quantization), הנתמכת על ידי ספריות כמו AutoAWQ, מגינה על משקולות קריטיות ("salient weights") שמושפעות ביותר בזמן ה-activation. גישה זו שומרת על דיוק גבוה משמעותית בכימות של 4-bit, ומאפשרת אינטגרציה חלקה עם מנועי הרצה מהירים כמו vLLM ו-Hugging Face.

הבחירה בין השיטות תלויה בחומרה ובשימוש: GGUF הוא המלך הבלתי מעורער של הרצה מקומית על מחשבים ניידים ומעבדים משולבים. AWQ ו-GPTQ מיועדים ל-GPUs ייעודיים (כמו כרטיסי Nvidia RTX) ומספקים מהירות הפקה גבוהה בהרבה בסביבות פרודקשן. הירידה באיכות (Perplexity) במעבר ל-4-bit היא מינורית ביותר ברוב המשימות, מה שהופך את הוויתור על הדיוק המלא למשתלם במיוחד במאבק בין האגדה על מלחמות המודלים: פתוח vs סגור ב-2026.

להלן דוגמה פשוטה להרצת מודל Llama 3 8B בפורמט GGUF מקומית באמצעות Python וספריית llama-cpp-python:

from llama_cpp import Llama

# טעינת מודל GGUF שעבר כימות ל-4-bit
llm = Llama(
    model_path="./llama-3-8b-Instruct-Q4_K_M.gguf",
    n_ctx=2048,  # אורך ההקשר
    n_threads=8  # מספר ליבות ה-CPU לשימוש
)

# הרצת פרומפט
output = llm("Q: What is the benefit of AWQ over GPTQ? A:", max_tokens=100)
print(output["choices"][0]["text"])

הצעד הבא שלכם: הורידו את כלי ה-CLI של llama.cpp, הורידו מודל Llama 3 8B בפורמט GGUF (למשל גרסת Q4_K_M מ-Hugging Face), והריצו אותו מקומית דרך הטרמינל שלכם. זו הדרך המהירה ביותר להבין את העוצמה של מודלים מכומתים על המחשב האישי שלכם.

פרויקטי התחלה2 REPOS
llama.cpp + GGUF
★ 70k
cpp מתקדם
הפורמט הסטנדרטי לקבצי quantized. 4-bit לרוב, 8-bit ליעדים גבוהים. הריצו 70B על MacBook.
huggingface-cli download bartowski/Meta-Llama-3.3-70B-Instruct-GGUF Q4_K_M.gguf
GitHub ↗
AutoAWQ
★ 2.2k
python מתקדם
Activation-aware Weight Quantization — איכות גבוהה ב-4-bit. אינטגרציה עם vLLM/HF.
pip install autoawq
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
02YT AI Engineer · וידאו · מתקדם
מדוע AI מוכן לא מבין כסף
מודלים של AI מתקדמים אינם מבינים כסף. על פי Udi Menkes, הם נותנים עצות שגויות עם ביטחון מלא. הפתרון הוא 'יציקה' של נתונים אמיתיים.
03Vercel AI SDK · כתבה · בינוני
@ai-sdk/workflow עדכון
חברת Vercel עדכנה את ה-SDK שלה. העדכון כולל עדכונים לתלויות ושיפורים אחרים.
04YT AI Engineer · וידאו · מתקדם
אינטגרציה של סוכנים AI במערכות Event-Sourced
Divakar Kumar מציג גישה להוספת שכבת סוכנים AI למערכות קיימות. הסוכנים עובדים על אירועים ומחליטים במקרים אמביגויים. הגישה משתמשת בארכיטקטורת event-sourced קיימת, ומוסיפה שכבה סמנטית וסוכנים המתקשרים באופן א-סינכרוני.
05YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.
06YT AI Engineer · וידאו · מתקדם
הגברת ה-Hugging Face Hub ללא קריסה
ה-Hugging Face Hub משרת 14 מיליון משתמשים ומיליון סטים נתונים. חיפוש מהיר נעשה אפשרי באמצעות Apache Lucene ו-MongoDB Atlas. המערכת משתמשת בשבעה צומתי MongoDB, כאשר רק הצומת הראשי מקבל כתיבה.
07Vercel AI SDK · כתבה · בינוני
עדכון @ai-sdk/workflow-harness@1.0.45
חברת Vercel הוציאה עדכון לחבילת @ai-sdk/workflow-harness. העדכון כולל שיפורים באפשרויות generateObject ו-streamObject, וכן עדכונים לתלויות החבילה.
08YT AI Engineer · וידאו · מתקדם
סוכנים מלאכותיים לביצועים: משלוח מהיר, תשלום פחות
צוותו של ראג'אט שאה בנטפליקס בנה סוכן לטיפול בבעיות ביצועים. הסוכן מזהה בעיות, מציע פתרונות ומאשר אותם. הדבר מאפשר משלוח מהיר יותר ותשלום פחות.
16

RAG מקומי לחלוטין — Ollama + Chroma

מערכת RAG שלמה רצה על המחשב שלך, ללא APIs חיצוניים. embedding מקומי + DB מקומי.

~4 שעותבינוני
שיעור

מערכת RAG (Retrieval-Augmented Generation) מקומית לחלוטין מאפשרת לנו לבנות יישומי בינה מלאכותית חכמים המבוססים על המידע הפרטי שלנו, מבלי לשלוח אף פיסת מידע לענן. השילוב בין Ollama (להרצת מודלי שפה ומודלי Embeddings מקומיים) לבין Chroma (מסד נתונים וקטורי קל ומהיר) מייצר סביבת עבודה עצמאית לחלוטין, הפועלת ישירות על המחשב האישי שלכם.

הסיבות המרכזיות למעבר ל-RAG מקומי הן פרטיות מידע מוחלטת, אבטחה, וחיסכון בעלויות API. בארגונים רבים, מידע רגיש אינו יכול לצאת מגבולות הרשת המקומית. בנוסף, פיתוח מקומי מאפשר בדיקה מהירה של ארכיטקטורות RAG שונות ללא חשש מעלויות מצטברות. עם זאת, עבודה מקומית דורשת הבנה של מגבלות המודלים. מחקרים כמו השטח המת של הייחוס מראים כי מודלים מקומיים לעיתים מתקשים להבחין בין ידע מאוחזר לבין הזיכרון הפנימי שלהם, בעוד שמחקרים אחרים כגון לזהות זה לא לפתור: פער הניטור והבקרה במערכות RAG מדגישים את החשיבות של בקרה וניטור קפדניים על איכות האחזור גם בסביבה מקומית.

כדי להקים מערכת כזו, אנו משתמשים ב-Ollama כדי להריץ מודל שפה (כמו Llama 3) ומודל ייצוג וקטורי (Embedding). הטקסטים שלנו עוברים תהליך של "צ'אנקניג" (פירוק למקטעים), מומרים לווקטורים באמצעות מודל ה-Embedding, ונשמרים בתוך Chroma DB. כאשר המשתמש שואל שאלה, השאלה מומרת לווקטור, Chroma שולף את המקטעים הרלוונטיים ביותר, ואלו נשלחים יחד עם השאלה כהקשר (Context) למודל השפה המקומי ב-Ollama שמייצר את התשובה הסופית.

הנה דוגמה פשוטה המציגה כיצד ניתן לחבר את הרכיבים הללו באמצעות Python וספריית Chroma:

import chromadb
from chromadb.utils import embedding_functions

# חיבור ל-Chroma מקומי והגדרת מודל Embedding של Ollama
client = chromadb.PersistentClient(path="./chroma_db")
ollama_ef = embedding_functions.OllamaEmbeddingFunction(
    url="http://localhost:11434/api/embeddings",
    model_name="nomic-embed-text"
)
collection = client.get_or_create_collection(name="local_docs", embedding_function=ollama_ef)

# הוספת מסמכים ואחזור
collection.add(documents=["Ollama runs LLMs locally", "Chroma is a vector database"], ids=["id1", "id2"])
results = collection.query(query_texts=["What is Chroma?"], n_results=1)
print(results["documents"])

הצעד הבא שלכם הוא להתקין את Ollama על המחשב, להוריד מודל כמו llama3 ומודל embedding כמו nomic-embed-text. לאחר מכן, מומלץ להוריד ולהריץ את פרויקט הקוד Ollama + Chroma כדי לראות את המערכת בפעולה, או להשתמש ב-LlamaIndex כדי לבנות צינורות RAG מתקדמים ומורכבים יותר בקלות.

פרויקטי התחלה3 REPOS
Cloudflare RAG Starter
★ 800
typescript בינוני
תבנית RAG מלאה — Workers + Vectorize + Workers AI. רצה חינם, deploy בקליק.
npm create cloudflare@latest -- --template=cloudflare/templates/rag-ai-tutorial
GitHub ↗
Ollama + Chroma
★ 17k
python בינוני
Chroma DB מקומי + Ollama. embedding מקומי, retrieval מקומי, generation מקומי — אפס APIs חיצוניים.
pip install chromadb && curl -fsSL https://ollama.com/install.sh | sh
GitHub ↗
LlamaIndex
★ 38k
python בינוני
הספרייה המקיפה ל-RAG. תומכת Ollama/HuggingFace embedders, Chroma/Qdrant/Pinecone retrievers.
pip install llama-index llama-index-llms-ollama llama-index-embeddings-huggingface
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
CrabRAG: מדוע עוזרים אוטומטיים זקוקים לזיכרון גרפי, לא ליותר טוקנים
סטיבן צ'ין הדגים את CrabRAG, טכנולוגיה המשתמשת בזיכרון גרפי כדי לשפר את ביצועיהם של עוזרים אוטומטיים. הוא הראה כיצד זיכרון גרפי מתגבר על מגבלות זיכרון וקטורי. Claude, העוזר האוטומטי, יכול לכתוב Cypher, שפת גרפים, טוב יותר מאשר אדם.
02Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
03YT AI Engineer · וידאו · מתקדם
דילוג על מס לרב-מודאלי: RAG היברידי, SQL RRF וטלמטריה UI
אבד מתיני מציג פרוטוטיפ לממשק צ'אטבוט המשלב RAG היברידי, SQL RRF וטלמטריה UI. הדגמה תציג איך לחסוך בעלויות API ולשפר ביצועים.
04YT AI Engineer · וידאו · מתקדם
תורבוצ'רג' את זיכרון האג'נט עם TurboQuant
TurboQuant הוא שיטה לדחיסת וקטורים ל-3–4 ביטים, תוך שמירה על איכות. הוא פותח על ידי Google Research ויכול לשמש לשיפור זיכרון האג'נט.
05YT AI Engineer · וידאו · בינוני
מבנה ללא-מבנה - סדריק קליבורן, Red Hat
ארגונים מודרניים מייצרים כמויות גדולות של נתונים בפורמטים שונים ולעיתים לא מובנים. האתגר הוא לשמר את המבנה, ההקשר והיחסים בתוך הנתונים. סדריק קליבורן מ-Red Hat מדבר על טכניקות וכלים פתוחים להפיכת מסמכים לא-מובנים לפורמטים מובנים.
06CrewAI releases · כתבה · מתקדם
עדכון 1.14.7a4
עדכון 1.14.7a4 של LangChain כולל מעבר ל-FlowDefinition ותמיכה בבקרים חדשים. העדכון גם כולל עדכונים למסמכים.
07YT AI Engineer · וידאו · מתקדם
RAG - האם זהו סוף?
חברת Cursor הוסיפה חיפוש סמנטי וראתה עלייה של 24% בדיוק התשובות. RAG הוא לא רק חיפוש וקטורי, אלא גם חיפוש טקסט מלא, glob, regex ופילטרים.
08MarkTechPost · כתבה · מתקדם
גוגל מוסיפה Agentic RAG לפלטפורמת Gemini Enterprise Agent
גוגל הוסיפה Agentic RAG לפלטפורמת Gemini Enterprise Agent. הטכנולוגיה החדשה מאפשרת חיפוש רב-שלבי ומדויק יותר. היא עובדת עם מספר מקורות נתונים ומאפשרת חיפוש קרוס-קורפוס.
17

RAG מקומי לחלוטין — Ollama + Chroma

מערכת RAG שלמה רצה על המחשב שלך, ללא APIs חיצוניים. embedding מקומי + DB מקומי.

~4 שעותבינוני
שיעור

מערכת RAG (Retrieval-Augmented Generation) מקומית לחלוטין מאפשרת לנו לבנות יישומי בינה מלאכותית חכמים המבוססים על המידע הפרטי שלנו, מבלי לשלוח אף פיסת מידע לענן. השילוב בין Ollama (להרצת מודלי שפה ומודלי Embeddings מקומיים) לבין Chroma (מסד נתונים וקטורי קל ומהיר) מייצר סביבת עבודה עצמאית לחלוטין, הפועלת ישירות על המחשב האישי שלכם.

הסיבות המרכזיות למעבר ל-RAG מקומי הן פרטיות מידע מוחלטת, אבטחה, וחיסכון בעלויות API. בארגונים רבים, מידע רגיש אינו יכול לצאת מגבולות הרשת המקומית. בנוסף, פיתוח מקומי מאפשר בדיקה מהירה של ארכיטקטורות RAG שונות ללא חשש מעלויות מצטברות. עם זאת, עבודה מקומית דורשת הבנה של מגבלות המודלים. מחקרים כמו השטח המת של הייחוס מראים כי מודלים מקומיים לעיתים מתקשים להבחין בין ידע מאוחזר לבין הזיכרון הפנימי שלהם, בעוד שמחקרים אחרים כגון לזהות זה לא לפתור: פער הניטור והבקרה במערכות RAG מדגישים את החשיבות של בקרה וניטור קפדניים על איכות האחזור גם בסביבה מקומית.

כדי להקים מערכת כזו, אנו משתמשים ב-Ollama כדי להריץ מודל שפה (כמו Llama 3) ומודל ייצוג וקטורי (Embedding). הטקסטים שלנו עוברים תהליך של "צ'אנקניג" (פירוק למקטעים), מומרים לווקטורים באמצעות מודל ה-Embedding, ונשמרים בתוך Chroma DB. כאשר המשתמש שואל שאלה, השאלה מומרת לווקטור, Chroma שולף את המקטעים הרלוונטיים ביותר, ואלו נשלחים יחד עם השאלה כהקשר (Context) למודל השפה המקומי ב-Ollama שמייצר את התשובה הסופית.

הנה דוגמה פשוטה המציגה כיצד ניתן לחבר את הרכיבים הללו באמצעות Python וספריית Chroma:

import chromadb
from chromadb.utils import embedding_functions

# חיבור ל-Chroma מקומי והגדרת מודל Embedding של Ollama
client = chromadb.PersistentClient(path="./chroma_db")
ollama_ef = embedding_functions.OllamaEmbeddingFunction(
    url="http://localhost:11434/api/embeddings",
    model_name="nomic-embed-text"
)
collection = client.get_or_create_collection(name="local_docs", embedding_function=ollama_ef)

# הוספת מסמכים ואחזור
collection.add(documents=["Ollama runs LLMs locally", "Chroma is a vector database"], ids=["id1", "id2"])
results = collection.query(query_texts=["What is Chroma?"], n_results=1)
print(results["documents"])

הצעד הבא שלכם הוא להתקין את Ollama על המחשב, להוריד מודל כמו llama3 ומודל embedding כמו nomic-embed-text. לאחר מכן, מומלץ להוריד ולהריץ את פרויקט הקוד Ollama + Chroma כדי לראות את המערכת בפעולה, או להשתמש ב-LlamaIndex כדי לבנות צינורות RAG מתקדמים ומורכבים יותר בקלות.

פרויקטי התחלה3 REPOS
Cloudflare RAG Starter
★ 800
typescript בינוני
תבנית RAG מלאה — Workers + Vectorize + Workers AI. רצה חינם, deploy בקליק.
npm create cloudflare@latest -- --template=cloudflare/templates/rag-ai-tutorial
GitHub ↗
Ollama + Chroma
★ 17k
python בינוני
Chroma DB מקומי + Ollama. embedding מקומי, retrieval מקומי, generation מקומי — אפס APIs חיצוניים.
pip install chromadb && curl -fsSL https://ollama.com/install.sh | sh
GitHub ↗
LlamaIndex
★ 38k
python בינוני
הספרייה המקיפה ל-RAG. תומכת Ollama/HuggingFace embedders, Chroma/Qdrant/Pinecone retrievers.
pip install llama-index llama-index-llms-ollama llama-index-embeddings-huggingface
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
CrabRAG: מדוע עוזרים אוטומטיים זקוקים לזיכרון גרפי, לא ליותר טוקנים
סטיבן צ'ין הדגים את CrabRAG, טכנולוגיה המשתמשת בזיכרון גרפי כדי לשפר את ביצועיהם של עוזרים אוטומטיים. הוא הראה כיצד זיכרון גרפי מתגבר על מגבלות זיכרון וקטורי. Claude, העוזר האוטומטי, יכול לכתוב Cypher, שפת גרפים, טוב יותר מאשר אדם.
02Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
03YT AI Engineer · וידאו · מתקדם
דילוג על מס לרב-מודאלי: RAG היברידי, SQL RRF וטלמטריה UI
אבד מתיני מציג פרוטוטיפ לממשק צ'אטבוט המשלב RAG היברידי, SQL RRF וטלמטריה UI. הדגמה תציג איך לחסוך בעלויות API ולשפר ביצועים.
04YT AI Engineer · וידאו · מתקדם
תורבוצ'רג' את זיכרון האג'נט עם TurboQuant
TurboQuant הוא שיטה לדחיסת וקטורים ל-3–4 ביטים, תוך שמירה על איכות. הוא פותח על ידי Google Research ויכול לשמש לשיפור זיכרון האג'נט.
05YT AI Engineer · וידאו · בינוני
מבנה ללא-מבנה - סדריק קליבורן, Red Hat
ארגונים מודרניים מייצרים כמויות גדולות של נתונים בפורמטים שונים ולעיתים לא מובנים. האתגר הוא לשמר את המבנה, ההקשר והיחסים בתוך הנתונים. סדריק קליבורן מ-Red Hat מדבר על טכניקות וכלים פתוחים להפיכת מסמכים לא-מובנים לפורמטים מובנים.
06CrewAI releases · כתבה · מתקדם
עדכון 1.14.7a4
עדכון 1.14.7a4 של LangChain כולל מעבר ל-FlowDefinition ותמיכה בבקרים חדשים. העדכון גם כולל עדכונים למסמכים.
07YT AI Engineer · וידאו · מתקדם
RAG - האם זהו סוף?
חברת Cursor הוסיפה חיפוש סמנטי וראתה עלייה של 24% בדיוק התשובות. RAG הוא לא רק חיפוש וקטורי, אלא גם חיפוש טקסט מלא, glob, regex ופילטרים.
08MarkTechPost · כתבה · מתקדם
גוגל מוסיפה Agentic RAG לפלטפורמת Gemini Enterprise Agent
גוגל הוסיפה Agentic RAG לפלטפורמת Gemini Enterprise Agent. הטכנולוגיה החדשה מאפשרת חיפוש רב-שלבי ומדויק יותר. היא עובדת עם מספר מקורות נתונים ומאפשרת חיפוש קרוס-קורפוס.