יום שלישי, 15 בספטמבר 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים Open Source LLM
מסלול לימוד

Open Source LLM

Llama / Qwen / DeepSeek — fine-tuning, local inference, leaderboards, GGUF, vLLM.

20 שעות
17 צמתים
בינוני
01

ארכיטקטורה: מה בפנים של Llama/Qwen

איך מודלים מודרניים בנויים — RoPE, GQA, SwiGLU, RMSNorm. ההבדלים בין משפחות.

~3 שעותמתקדם
שיעור

מודלי שפה מודרניים כמו Llama 3 ו-Qwen 2.5 נראים ממבט ראשון כמו ה-Transformer המקורי מ-2017, אך מתחת למכסה המנוע הם עברו אבולוציה ארכיטקטונית דרמטית. במקום הארכיטקטורה הסטנדרטית של GPT-2, מודלים מודרניים אלו מתבססים על שילוב של ארבעה רכיבי מפתח: RMSNorm לייצוב הצימוד, SwiGLU כפונקציית אקטיבציה מתקדמת ב-FFN, RoPE לייצוג מיקום סיבובי, ו-GQA (Grouped-Query Attention) המאפשר יעילות חישובית יוצאת דופן בזמן הסקה (Inference). הבנת הרכיבים הללו היא קריטית לכל מי שמפתח, מאמן או מבצע אופטימיזציה למודלי קצה.

נתחיל בשיפורי היציבות והחישוב: RMSNorm (Root Mean Square Normalization) מחליף את ה-LayerNorm המסורתי על ידי ויתור על חישוב הממוצע (mean centering), מה שמקצר את זמן החישוב ב-10%-50% מבלי לפגוע בביצועים. בגזרת האקטיבציה, SwiGLU מחליפה את ה-GELU הסטנדרטית; היא משלבת את פונקציית Swish עם מנגנון Gated Linear Unit, מה שמאפשר למודל ללמוד ייצוגים מורכבים יותר אך דורש הגדלה קלה של מספר הפרמטרים בשכבת ה-Feed-Forward.

השינוי המשמעותי ביותר בביצועי ההקשר (Context Window) מגיע מ-RoPE (Rotary Position Embedding) ו-GQA. RoPE מייצג מיקום יחסי על ידי סיבוב וקטורי ה-Query וה-Key במרחב הדו-ממדי, מה שמאפשר אקסטרפולציה חלקה לאורכי הקשר עצומים (כמו 128K ב-Llama 3). במקביל, GQA פותר את צוואר הבקבוק של ה-KV Cache על ידי חלוקת ה-Keys וה-Values לקבוצות (Groups), כך שמספר ראשי ה-Query גדול ממספר ראשי ה-KV. זה מקטין דרמטית את דרישות הזיכרון בזמן Inference ומאפשר Batch Size גדול בהרבה.

כדי להבין איך הרכיבים הללו מתחברים יחד, מומלץ להסתכל על מימוש נקי של השכבות הללו. ספריית x-transformers של lucidrains מאפשרת להגדיר מודלים מותאמים אישית עם הרכיבים הללו בשורות קוד בודדות. הנה דוגמה קצרה להגדרת Transformer מודרני המשתמש ב-RMSNorm, SwiGLU ו-RoPE:

from x_transformers import TransformerWrapper, Decoder

# הגדרת מודל דמוי Llama עם ארכיטקטורה מודרנית
model = TransformerWrapper(
    num_tokens = 20000,
    max_seq_len = 1024,
    attn_layers = Decoder(
        dim = 512,
        depth = 6,
        heads = 8,
        attn_flash = True,           # שימוש ב-Flash Attention ליעילות
        rotary_pos_emb = True,       # RoPE (Rotary Position Embedding)
        ff_glu = True,               # SwiGLU Activation
        rms_norm = True              # RMSNorm במקום LayerNorm
    )
)

להעמקה נוספת בארכיטקטורות הללו והשפעתן על התנהגות המודל, אנו ממליצים לקרוא את המחקר על בחירה אוטומטית של שכבות לזיהוי הזיות במודלי שפה, המציג כיצד שכבות שונות בארכיטקטורות אלו מקודדות מידע סמנטי ואיפה נוצרות הזיות. בנוסף, כדאי לבחון את הדיון על ניהול זיכרון ארוך טווח במאמר האם זיכרון של סוכנים הוא מסד נתונים? כדי להבין כיצד חלון ההקשר המורחב משפיע על ארכיטקטורת סוכנים (Agents).

הצעד הבא שלכם: הורידו ושבטו את ה-Repository הרשמי של Llama 3 Implementation. עברו על קובץ model.py והתמקדו במימוש של פונקציית precompute_freqs_cis (המשמשת עבור RoPE) ובמחלקה Attention המממשת את ה-GQA. הריצו את ה-minimal generation script שלהם כדי לראות את הקוד פועל מקצה לקצה.

פרויקטי התחלה2 REPOS
x-transformers
★ 5.5k
python מתקדם
ספריית transformers ניסיונית. כל וריאנט מהמחקר (Llama/GPT/T5/Reformer) במחלקה אחת בהירה.
pip install x-transformers
GitHub ↗
Llama 3 Implementation
★ 28k
python מתקדם
הקוד הרשמי של Meta ל-Llama 3. mini-implementation מצוין להבנת RoPE, GQA, SwiGLU בפרודקשן.
git clone https://github.com/meta-llama/llama3
GitHub ↗
חומרי קריאה8 פריטים
01MarkTechPost · כתבה · מתקדם
H Company משחררת NeoMME: משפחה של 260M ו-800M Single-Tower Multimodal Encoders
H Company השיקה NeoMME, משפחה של 260M ו-800M Single-Tower Multimodal Encoders שמשימתם לקצץ בפרמטרים ובחישוב.
02MIT Tech Review AI · כתבה · מתקדם
תכנון ממוריאל ואחסון בעידן ה-AI
בעידן ה-AI, יש צורך בתכנון מחדש של הארכיטקטורה כדי לאופטימיזציה של הביצועים, העיכוב, והזיכרון.
03CrewAI releases · כתבה · מתקדם
שינויים
נוספו תכונות חדשות ותוקנו באגים במערכת.
04LangChain releases · כתבה · מתקדם
langchain-anthropic==1.7.0
langchain הוציאה גרסה 1.7.0 של האינטגרציה שלהם עם Anthropic. הגרסה כוללת תמיכה ב- param עבור skills דרך container, updates thinking display mode, ותמיכה ב-1.0 SDK.
05YT AI Engineer · וידאו · מתקדם
בניית המנוע בעת שטסים: השקת שרת MCP של Figma — Jesse Lumarie, Figma
שרת MCP של Figma נבנה כפרויקט 20%, על אף שהחברה לא הייתה ידועה בפרויקטים 20%. הוא הפך לאחד מהמוצרים המהירים ביותר ש-Figma שילחה לשוק. הפרויקט כלל שימוש במודלי Gemini ובכלים כמו React ו-Tailwind. השרת MCP של Figma הציע פתרון לבעיית האספקטיביות של המודלים, ואפשר למפתחים להשתמש בו כדי לפתח אפליקציות חדשות. הפרויקט הציג גם חידושים בתחום האינטראקציה עם המודלים, כמו שימוש בפונקציות של React ובכלים כמו Tailwind.
06YT AI Engineer · וידאו · מתקדם
פיתוח סדר עבודה אגנטי ב-Uber
מערכת ה-SDLC האגנטית של Uber מאפשרת ל-70% מהבקשות להצטרף מאגנטים מקומיים או בענן, ומכפלת את כמות הקוד למהנדס. המערכת כוללת שש יחידות תשתית, כולל גשר יחיד שעובר על כל קריאה למודל, ומכילה 2,500 פעילויות בשוק המיון. המערכת גם כוללת גרף של 150 צורות וקשרים, ו-40 מיליון פריטים, שמחליף 20-30 מערכות שונות שאגנטים עבדו עליהן.
07MarkTechPost · כתבה · מתקדם
Dyna Robotics משיקה Dyna-2: מודל עולם-פעולה מוכשר על מיליון שעות וידאו אנושי
Dyna Robotics השיקה Dyna-2, מודל עולם-פעולה שהוכשר על מיליון שעות וידאו אנושי. המודל מיועד לשימוש ברובוטים ויכול לבצע משימות שונות כגון אריזה וסידור. Dyna-2 נבדק במגוון תעשיות, כולל מלונאות, מסעדנות וניקיון.
08YT AI Engineer · וידאו · מתקדם
MCP Apps: הרחבת הגבולות
MCP Apps היא דרך לשרתי MCP להחזיר ממשק משתמש אינטראקטיבי במקום בלוק טקסט. המערכת מאפשרת תקשורת ב间יימדית בין השרת ללקוח, ומאפשרת 'כתיבה פעם אחת, ריצה בכל מקום'.
02

משפחת Llama

Llama 3.x — מתחילים, גדלים שונים, instruction-tuned.

~3 שעותבינוני
שיעור

משפחת מודלי Llama מבית Meta חוללה מהפכה בעולם ה-AI בקוד פתוח, כאשר סדרת Llama 3.x מייצגת את חזית הטכנולוגיה הנוכחית עבור מפתחים וחוקרים. מודלים אלו אומנו על כמויות עצומות של נתונים (טריליוני tokens) ומציעים ביצועים המתחרים במודלים מסחריים סגורים. הסדרה כוללת מודלים בגדלים שונים (כמו 8B, 70B ו-405B) המותאמים לצרכים שונים – החל מהרצה מקומית על מחשב נייד ועד לפריסות ענן מסיביות, כאשר גרסאות ה-Instruction-tuned עברו כוונון עדין מיוחד כדי להבין ולבצע הוראות מורכבות של משתמשים בצורה טבעית ומדויקת.

השימוש ב-Llama 3.x מומלץ במיוחד כאשר יש צורך בפרטיות מידע מלאה, שליטה בעלויות ה-Inference, או התאמה אישית (Fine-tuning) של המודל למשימות ספציפיות. בניגוד לשימוש ב-APIs סגורים של חברות כמו OpenAI או Anthropic, הרצת Llama 3.x מקומית או על שרת פרטי מבטיחה שהנתונים הרגישים שלכם לעולם לא יעזבו את הארגון. בנוסף, הגרסאות הקטנות יותר (כמו Llama 3 8B) מציעות יחס עלות-תועלת מעולה, ומאפשרות לבנות יישומי סוכנים (Agents) ומערכות RAG (Retrieval-Augmented Generation) יעילות ומהירות במיוחד.

כדי להתחיל לעבוד עם Llama 3.x, הדרך הפשוטה והמהירה ביותר היא שימוש בכלים כמו Ollama, המאפשר להריץ את המודל מקומית בפקודה אחת פשוטה, או בפרויקט llama.cpp המאפשר ביצועים אופטימליים על מעבדים רגילים (CPU) וכרטיסי מסך מגוונים באמצעות קוונטיזציה (Quantization) בפורמט GGUF. לאחר שהמודל רץ מקומית, ניתן לחבר אותו בקלות לספריות פיתוח פופולריות כמו LlamaIndex כדי להתחיל לתשאל מסמכים ולבנות יישומי בינה מלאכותית מתקדמים.

הנה דוגמה קצרה המציגה כיצד לפנות למודל Llama 3 הרץ באופן מקומי באמצעות Ollama ולתשאל אותו בעזרת קוד Python פשוט:

import requests

url = "http://localhost:11434/api/generate"
payload = {
    "model": "llama3",
    "prompt": "Explain briefly what a Large Language Model is.",
    "stream": False
}

response = requests.post(url, json=payload)
print(response.json().get("response"))

ככל שהפרויקט שלכם גדל, תרצו לשלב את Llama 3.x עם מנועי חיפוש ומאגרי מידע. ספריות כמו LlamaIndex מעדכנות באופן תדיר את התמיכה שלהן במודלים אלו ובאינטגרציות השונות. מומלץ לעקוב אחר העדכונים האחרונים, כגון LlamaIndex v0.14.19 וכן LlamaIndex v0.14.18, המציגים שיפורים בליבת המערכת וביכולות העבודה עם סוכני AI ומודלים מקומיים, כפי שמתואר גם בגרסת llama-index-core 0.14.16.

הצעד הבא שלכם: הורידו והתקינו את Ollama במחשב שלכם. לאחר ההתקנה, פתחו את הטרמינל והריצו את הפקודה ollama run llama3 כדי להתחיל לשוחח עם המודל ישירות מה-CLI. לאחר מכן, נסו להריץ את קוד הפייתון שלמעלה כדי לחבר את המודל לאפליקציה הראשונה שלכם!

פרויקטי התחלה2 REPOS
Ollama
★ 100k
go מתחילים
דרך הכי מהירה להריץ Llama/Qwen/DeepSeek/Mistral מקומית. CLI + REST API.
curl -fsSL https://ollama.com/install.sh | sh && ollama run llama3.3
GitHub ↗
llama.cpp
★ 70k
cpp בינוני
אינפרנס C++ נטו. הכי מהיר ל-CPU/Metal. GGUF quantization.
git clone https://github.com/ggerganov/llama.cpp && make
GitHub ↗
חומרי קריאה8 פריטים
01Ahead of AI · כתבה · בינוני
בניית מזהה טקסט AI מאפס
Substack השיקה תכונת AI detector. המחבר בונה מזהה טקסט AI פשוט כדי להראות איך הוא עובד. המטרה היא ליצור כלי לאיתור תוכן מזויף ולשפר כתיבה אישית.
02YT AI Engineer · וידאו · מתקדם
מעבר לאינטליגנציה סטטית: הערכת למידה רציפה
חוקרים בודקים את היכולת של מודלים ללמוד באופן רציף. המחקר מציג ביקורת על הדרך הנוכחית להערכת מודלים, ומציע גישה חדשה למדידת הלמידה הרציפה. הניסויים מראים כי למידה רציפה יכולה להיות יותר יעילה משיטות אחרות.
03Interconnects · כתבה · מתקדם
5 דברים שומשים שתלמדו בספר החדש
ספר חדש על אימון מודלים LLM. הספר עוסק בנושאים כמו דגימת סירוב ואימון דמויות. הוא מספק הסברים פשוטים על מנגנוני האימון
04Import AI · כתבה · מתקדם
וירוסי AI עצמאיים
חוקרים פיתחו וירוס AI עצמאי שמשתמש במודלים לפריצה למחשבים, ואז מנצל את משאבי ה-GPU שלהם להרצת הידור, מה שמאפשר לו להתפשט באופן עצמאי. הווירוס משתמש ב-LLM פתוח כדי לזהות פרצות אבטחה ולתכנן התקפות מותאמות.
05YT Cole Medin · וידאו · בינוני
בסיס הידע האולטימטיבי: הבא את YouTube לתוך מוח ה-AI השני שלך
הפיכת ערוצי YouTube לבסיסי ידע עם Claude Code. המערכת משתמשת ב-Google OKF, תקן חדש לוויקים של LLM, ומאפשרת לסוכנים ללמוד מידית. היא תומכת בהמרה למרקדאון ויכולה לשמש עם Obsidian.
06YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
07YT AI Engineer · וידאו · מתקדם
הנדסת פרסונה: מדריך שדה לפרסונות סינתטיות
פרסונות סינתטיות משוכללות מתאימות לבני אדם במחקרי שוק. קבוצת מחקר השתמשה במודל LLM כדי ליצור פרסונות סינתטיות שחיקו את התשובות של בני אדם. התוצאות הראו שהפרסונות הסינתטיות היו דומות מאוד לתשובות האנושיות, אך עם פחות רעש.
08YT Matthew Berman · וידאו · בינוני
אכזבה
אנתרופיק פרסמה מודל משקלים פתוח. מטא-איי דלפה את המודל לאמה. נידון האם הקוד הפתוח ינצח.
03

משפחת Llama

Llama 3.x — מתחילים, גדלים שונים, instruction-tuned.

~3 שעותבינוני
שיעור

משפחת מודלי Llama מבית Meta חוללה מהפכה בעולם ה-AI בקוד פתוח, כאשר סדרת Llama 3.x מייצגת את חזית הטכנולוגיה הנוכחית עבור מפתחים וחוקרים. מודלים אלו אומנו על כמויות עצומות של נתונים (טריליוני tokens) ומציעים ביצועים המתחרים במודלים מסחריים סגורים. הסדרה כוללת מודלים בגדלים שונים (כמו 8B, 70B ו-405B) המותאמים לצרכים שונים – החל מהרצה מקומית על מחשב נייד ועד לפריסות ענן מסיביות, כאשר גרסאות ה-Instruction-tuned עברו כוונון עדין מיוחד כדי להבין ולבצע הוראות מורכבות של משתמשים בצורה טבעית ומדויקת.

השימוש ב-Llama 3.x מומלץ במיוחד כאשר יש צורך בפרטיות מידע מלאה, שליטה בעלויות ה-Inference, או התאמה אישית (Fine-tuning) של המודל למשימות ספציפיות. בניגוד לשימוש ב-APIs סגורים של חברות כמו OpenAI או Anthropic, הרצת Llama 3.x מקומית או על שרת פרטי מבטיחה שהנתונים הרגישים שלכם לעולם לא יעזבו את הארגון. בנוסף, הגרסאות הקטנות יותר (כמו Llama 3 8B) מציעות יחס עלות-תועלת מעולה, ומאפשרות לבנות יישומי סוכנים (Agents) ומערכות RAG (Retrieval-Augmented Generation) יעילות ומהירות במיוחד.

כדי להתחיל לעבוד עם Llama 3.x, הדרך הפשוטה והמהירה ביותר היא שימוש בכלים כמו Ollama, המאפשר להריץ את המודל מקומית בפקודה אחת פשוטה, או בפרויקט llama.cpp המאפשר ביצועים אופטימליים על מעבדים רגילים (CPU) וכרטיסי מסך מגוונים באמצעות קוונטיזציה (Quantization) בפורמט GGUF. לאחר שהמודל רץ מקומית, ניתן לחבר אותו בקלות לספריות פיתוח פופולריות כמו LlamaIndex כדי להתחיל לתשאל מסמכים ולבנות יישומי בינה מלאכותית מתקדמים.

הנה דוגמה קצרה המציגה כיצד לפנות למודל Llama 3 הרץ באופן מקומי באמצעות Ollama ולתשאל אותו בעזרת קוד Python פשוט:

import requests

url = "http://localhost:11434/api/generate"
payload = {
    "model": "llama3",
    "prompt": "Explain briefly what a Large Language Model is.",
    "stream": False
}

response = requests.post(url, json=payload)
print(response.json().get("response"))

ככל שהפרויקט שלכם גדל, תרצו לשלב את Llama 3.x עם מנועי חיפוש ומאגרי מידע. ספריות כמו LlamaIndex מעדכנות באופן תדיר את התמיכה שלהן במודלים אלו ובאינטגרציות השונות. מומלץ לעקוב אחר העדכונים האחרונים, כגון LlamaIndex v0.14.19 וכן LlamaIndex v0.14.18, המציגים שיפורים בליבת המערכת וביכולות העבודה עם סוכני AI ומודלים מקומיים, כפי שמתואר גם בגרסת llama-index-core 0.14.16.

הצעד הבא שלכם: הורידו והתקינו את Ollama במחשב שלכם. לאחר ההתקנה, פתחו את הטרמינל והריצו את הפקודה ollama run llama3 כדי להתחיל לשוחח עם המודל ישירות מה-CLI. לאחר מכן, נסו להריץ את קוד הפייתון שלמעלה כדי לחבר את המודל לאפליקציה הראשונה שלכם!

פרויקטי התחלה2 REPOS
Ollama
★ 100k
go מתחילים
דרך הכי מהירה להריץ Llama/Qwen/DeepSeek/Mistral מקומית. CLI + REST API.
curl -fsSL https://ollama.com/install.sh | sh && ollama run llama3.3
GitHub ↗
llama.cpp
★ 70k
cpp בינוני
אינפרנס C++ נטו. הכי מהיר ל-CPU/Metal. GGUF quantization.
git clone https://github.com/ggerganov/llama.cpp && make
GitHub ↗
חומרי קריאה8 פריטים
01Ahead of AI · כתבה · בינוני
בניית מזהה טקסט AI מאפס
Substack השיקה תכונת AI detector. המחבר בונה מזהה טקסט AI פשוט כדי להראות איך הוא עובד. המטרה היא ליצור כלי לאיתור תוכן מזויף ולשפר כתיבה אישית.
02YT AI Engineer · וידאו · מתקדם
מעבר לאינטליגנציה סטטית: הערכת למידה רציפה
חוקרים בודקים את היכולת של מודלים ללמוד באופן רציף. המחקר מציג ביקורת על הדרך הנוכחית להערכת מודלים, ומציע גישה חדשה למדידת הלמידה הרציפה. הניסויים מראים כי למידה רציפה יכולה להיות יותר יעילה משיטות אחרות.
03Interconnects · כתבה · מתקדם
5 דברים שומשים שתלמדו בספר החדש
ספר חדש על אימון מודלים LLM. הספר עוסק בנושאים כמו דגימת סירוב ואימון דמויות. הוא מספק הסברים פשוטים על מנגנוני האימון
04Import AI · כתבה · מתקדם
וירוסי AI עצמאיים
חוקרים פיתחו וירוס AI עצמאי שמשתמש במודלים לפריצה למחשבים, ואז מנצל את משאבי ה-GPU שלהם להרצת הידור, מה שמאפשר לו להתפשט באופן עצמאי. הווירוס משתמש ב-LLM פתוח כדי לזהות פרצות אבטחה ולתכנן התקפות מותאמות.
05YT Cole Medin · וידאו · בינוני
בסיס הידע האולטימטיבי: הבא את YouTube לתוך מוח ה-AI השני שלך
הפיכת ערוצי YouTube לבסיסי ידע עם Claude Code. המערכת משתמשת ב-Google OKF, תקן חדש לוויקים של LLM, ומאפשרת לסוכנים ללמוד מידית. היא תומכת בהמרה למרקדאון ויכולה לשמש עם Obsidian.
06YT AI Engineer · וידאו · מתקדם
איך Nubank בדקה 2000 כישורי AI
לוקאס פאלמה, Nubank, בנה Skill Vector לבדיקת כישורי AI. 2000 כישורים נבדקו, ונמצאו בעיות. הפתרון: בדיקה דטרמיניסטית + LLM. הלקח: יש לטפל בכישורי AI כמו בתלות רגילה.
07YT AI Engineer · וידאו · מתקדם
הנדסת פרסונה: מדריך שדה לפרסונות סינתטיות
פרסונות סינתטיות משוכללות מתאימות לבני אדם במחקרי שוק. קבוצת מחקר השתמשה במודל LLM כדי ליצור פרסונות סינתטיות שחיקו את התשובות של בני אדם. התוצאות הראו שהפרסונות הסינתטיות היו דומות מאוד לתשובות האנושיות, אך עם פחות רעש.
08YT Matthew Berman · וידאו · בינוני
אכזבה
אנתרופיק פרסמה מודל משקלים פתוח. מטא-איי דלפה את המודל לאמה. נידון האם הקוד הפתוח ינצח.
04

Qwen + DeepSeek

מודלים סיניים מובילים — תכונות ייחודיות, ביצועים.

~3 שעותבינוני
שיעור

בשנים האחרונות, עולם ה-AI חווה תפנית דרמטית עם פריצתם של מודלים מובילים מסין, ובראשם Qwen (מבית Alibaba) ו-DeepSeek. מודלים אלו אינם רק אלטרנטיבה למודלים המערביים המוכרים, אלא לעיתים קרובות מובילים במדדי הביצועים (Benchmarks) העולמיים, במיוחד בתחומי התכנות, המתמטיקה והחשיבה הלוגית (Reasoning). הם מציעים ארכיטקטורות מתקדמות ויעילות כלכלית יוצאת דופן, מה שהופך אותם לבחירה מועדפת עבור מפתחים וחוקרים ברחבי העולם.

הכוח של מודלים אלו טמון ביעילות הארכיטקטונית שלהם. מודלי DeepSeek, למשל, עושים שימוש נרחב בטכנולוגיית Mixture of Experts (MoE) המאפשרת להפעיל רק חלק קטן מהפרמטרים בכל שאילתה, ובכך לחסוך משאבי חישוב עצומים מבלי לפגוע באיכות התשובה. מנגד, סדרת Qwen2.5 מציעה ביצועים פנומנליים במגוון שפות ויכולות קידוד שמאתגרות את המודלים הסגורים המובילים בשוק. השימוש במודלים אלו מומלץ במיוחד כאשר נדרשת פריסה מקומית (On-premise) של מודלים חזקים, או כאשר יש צורך בביצועים גבוהים בעלויות תפעול נמוכות.

עם זאת, העבודה עם מודלים אלו מביאה איתה אתגרים ייחודיים. ראשית, בשל גודלם, הרצתם על חומרה מקומית דורשת שימוש בטכניקות דחיסה וקוונטיזציה מתקדמות, כפי שמתואר במחקר על שיטת דחיסה טנסורית יעילה למודלי שפה גדולים. שנית, מפתחים צריכים להיות מודעים להבדלים תרבותיים וגאו-פוליטיים המשפיעים על אופן אימון המודלים והטיית התוכן שלהם, נושא שנחקר בהרחבה במאמר על הטיה גיאופוליטית במודלים לשוניים.

כדי להתחיל לעבוד עם מודלים אלו בצורה פשוטה ויעילה, הדרך המומלצת ביותר היא שימוש בכלי Ollama, המאפשר להריץ מודלי קצה מקומית על המחשב האישי שלכם בלחיצת כפתור. בעזרת Ollama תוכלו למשוך גרסאות מותאמות של Qwen או DeepSeek ולהשתמש בהן ישירות מתוך קוד Python.

להלן דוגמה מינימלית להרצת שאילתה מקומית מול מודל DeepSeek באמצעות ספריית Python הרשמית של Ollama:

import ollama

# שליחת שאילתה למודל DeepSeek-R1 המורץ מקומית
response = ollama.chat(model='deepseek-r1:8b', messages=[
    {
        'role': 'user',
        'content': 'Explain the difference between MoE and dense LLMs in one sentence.',
    },
])

print(response['message']['content'])

הצעד הבא שלכם:

הורידו והתקינו את Ollama על המחשב שלכם. לאחר מכן, פתחו את הטרמינל והריצו את הפקודה ollama run deepseek-r1:8b (או qwen2.5:14b). הפרויקט הראשון שלכם יהיה לבנות סקריפט Python קצר המשתמש במודל המקומי כדי לנתח קובץ קוד מקור ולמצוא בו באגים - ללא צורך בחיבור לאינטרנט או בתשלום על API!

פרויקטי התחלה1 REPOS
Qwen + DeepSeek via Ollama
★ 100k
go מתחילים
מודלים סיניים מובילים — ollama pull qwen2.5:72b / deepseek-r1.
ollama pull qwen2.5:72b
GitHub ↗
חומרי קריאה8 פריטים
01Last Week in AI · פודקאסט · מתקדם
LWiAI פודקאסט #255 - Gemini 3.7, Jalapeño, Qwen 3.8, רחפנים
פודקאסט LWiAI #255 דן בחדשות AI הגדולות של השבוע, כולל Gemini 3.7, Jalapeño, Qwen 3.8 ורחפנים. SpaceXAI הוציאה Grok 4.6 עם 500K הקשר. OpenAI חשפה תוצאות ראשונות של Jalapeno.
02YT AI Engineer · וידאו · מתקדם
הבאת למידה רציפה לתאגידים
חברת Applied Compute שיפרה את מודל Qwen באמצעות למידה רציפה. המודל הצליח להגיע לקצאת 40 ולשפר את שיעור ההצלחה. החידוש הושג באמצעות מנגנון שמאפשר למודל ללמוד מניסיונות קודמים.
03MarkTechPost · כתבה · מתקדם
Alibaba Qwen משחרר Qwen3.8-Max: מודל MoE בן 2.4 טריליון פרמטרים
Qwen3.8-Max הוא מודל MoE בן 2.4 טריליון פרמטרים שמקבל טקסט, תמונה ווידאו ומחזיר טקסט. המודל זמין להורדה ולשימוש.
04YT AI Engineer · וידאו · מתקדם
בדיקת וידאו מלאכותי
חברת Character.ai פיתחה שיטה לבדיקת וידאו מלאכותי. השיטה משתמשת במודל Qwen3-VL כדי להעריך איכות הווידאו. המודל מאפשר לזהות בעיות כגון חוסר עקביות זמנית ואיכות ירודה.
05YT AI Engineer · וידאו · מתקדם
מפעל שחולם: 39 סוכנים AI, ללא פריימוורק
חברה הודית בנתה מערכת הפעלה רב-סוכנית AI, המורכבת מ-39 סוכנים מומחים, ללא שימוש בפריימוורק. המערכת, הנקראת Ira, משמשת כמוח החברה, ומטפלת במשימות עסקיות שונות, כגון מכירות, פיתוח עסקי, גיוס, וניהול.
06Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
07YT IndyDevDan · וידאו · מתקדם
GLM-5.2 ו-MiniMax-M3: תחרות אמיתית ל-Opus
GLM-5.2 ו-MiniMax-M3 הם מודלים חדשים שמתחרים ב-Opus. GLM-5.2 הוא המודל המוביל ב-Intelligence Index, ו-MiniMax-M3 הוא המודל הזול יותר. השניים מתחרים בביצועים ובמחיר.
08MarkTechPost · כתבה · מתקדם
DeepReinforce משחרר Ornith-1.0: משפחת מודלים קודים פתוחים
DeepReinforce השחררה את Ornith-1.0, משפחת מודלים פתוחים לקודים. המודלים מבוססים על Gemma 4 ו-Qwen 3.5. Ornith-1.0 לומדת לכתוב את הסקאפולד שלה בעצמה, והיא כוללת ארבעה גדלים: 9B, 31B, 35B-MoE ו-397B-MoE.
05

Qwen + DeepSeek

מודלים סיניים מובילים — תכונות ייחודיות, ביצועים.

~3 שעותבינוני
שיעור

בשנים האחרונות, עולם ה-AI חווה תפנית דרמטית עם פריצתם של מודלים מובילים מסין, ובראשם Qwen (מבית Alibaba) ו-DeepSeek. מודלים אלו אינם רק אלטרנטיבה למודלים המערביים המוכרים, אלא לעיתים קרובות מובילים במדדי הביצועים (Benchmarks) העולמיים, במיוחד בתחומי התכנות, המתמטיקה והחשיבה הלוגית (Reasoning). הם מציעים ארכיטקטורות מתקדמות ויעילות כלכלית יוצאת דופן, מה שהופך אותם לבחירה מועדפת עבור מפתחים וחוקרים ברחבי העולם.

הכוח של מודלים אלו טמון ביעילות הארכיטקטונית שלהם. מודלי DeepSeek, למשל, עושים שימוש נרחב בטכנולוגיית Mixture of Experts (MoE) המאפשרת להפעיל רק חלק קטן מהפרמטרים בכל שאילתה, ובכך לחסוך משאבי חישוב עצומים מבלי לפגוע באיכות התשובה. מנגד, סדרת Qwen2.5 מציעה ביצועים פנומנליים במגוון שפות ויכולות קידוד שמאתגרות את המודלים הסגורים המובילים בשוק. השימוש במודלים אלו מומלץ במיוחד כאשר נדרשת פריסה מקומית (On-premise) של מודלים חזקים, או כאשר יש צורך בביצועים גבוהים בעלויות תפעול נמוכות.

עם זאת, העבודה עם מודלים אלו מביאה איתה אתגרים ייחודיים. ראשית, בשל גודלם, הרצתם על חומרה מקומית דורשת שימוש בטכניקות דחיסה וקוונטיזציה מתקדמות, כפי שמתואר במחקר על שיטת דחיסה טנסורית יעילה למודלי שפה גדולים. שנית, מפתחים צריכים להיות מודעים להבדלים תרבותיים וגאו-פוליטיים המשפיעים על אופן אימון המודלים והטיית התוכן שלהם, נושא שנחקר בהרחבה במאמר על הטיה גיאופוליטית במודלים לשוניים.

כדי להתחיל לעבוד עם מודלים אלו בצורה פשוטה ויעילה, הדרך המומלצת ביותר היא שימוש בכלי Ollama, המאפשר להריץ מודלי קצה מקומית על המחשב האישי שלכם בלחיצת כפתור. בעזרת Ollama תוכלו למשוך גרסאות מותאמות של Qwen או DeepSeek ולהשתמש בהן ישירות מתוך קוד Python.

להלן דוגמה מינימלית להרצת שאילתה מקומית מול מודל DeepSeek באמצעות ספריית Python הרשמית של Ollama:

import ollama

# שליחת שאילתה למודל DeepSeek-R1 המורץ מקומית
response = ollama.chat(model='deepseek-r1:8b', messages=[
    {
        'role': 'user',
        'content': 'Explain the difference between MoE and dense LLMs in one sentence.',
    },
])

print(response['message']['content'])

הצעד הבא שלכם:

הורידו והתקינו את Ollama על המחשב שלכם. לאחר מכן, פתחו את הטרמינל והריצו את הפקודה ollama run deepseek-r1:8b (או qwen2.5:14b). הפרויקט הראשון שלכם יהיה לבנות סקריפט Python קצר המשתמש במודל המקומי כדי לנתח קובץ קוד מקור ולמצוא בו באגים - ללא צורך בחיבור לאינטרנט או בתשלום על API!

פרויקטי התחלה1 REPOS
Qwen + DeepSeek via Ollama
★ 100k
go מתחילים
מודלים סיניים מובילים — ollama pull qwen2.5:72b / deepseek-r1.
ollama pull qwen2.5:72b
GitHub ↗
חומרי קריאה8 פריטים
01Last Week in AI · פודקאסט · מתקדם
LWiAI פודקאסט #255 - Gemini 3.7, Jalapeño, Qwen 3.8, רחפנים
פודקאסט LWiAI #255 דן בחדשות AI הגדולות של השבוע, כולל Gemini 3.7, Jalapeño, Qwen 3.8 ורחפנים. SpaceXAI הוציאה Grok 4.6 עם 500K הקשר. OpenAI חשפה תוצאות ראשונות של Jalapeno.
02YT AI Engineer · וידאו · מתקדם
הבאת למידה רציפה לתאגידים
חברת Applied Compute שיפרה את מודל Qwen באמצעות למידה רציפה. המודל הצליח להגיע לקצאת 40 ולשפר את שיעור ההצלחה. החידוש הושג באמצעות מנגנון שמאפשר למודל ללמוד מניסיונות קודמים.
03MarkTechPost · כתבה · מתקדם
Alibaba Qwen משחרר Qwen3.8-Max: מודל MoE בן 2.4 טריליון פרמטרים
Qwen3.8-Max הוא מודל MoE בן 2.4 טריליון פרמטרים שמקבל טקסט, תמונה ווידאו ומחזיר טקסט. המודל זמין להורדה ולשימוש.
04YT AI Engineer · וידאו · מתקדם
בדיקת וידאו מלאכותי
חברת Character.ai פיתחה שיטה לבדיקת וידאו מלאכותי. השיטה משתמשת במודל Qwen3-VL כדי להעריך איכות הווידאו. המודל מאפשר לזהות בעיות כגון חוסר עקביות זמנית ואיכות ירודה.
05YT AI Engineer · וידאו · מתקדם
מפעל שחולם: 39 סוכנים AI, ללא פריימוורק
חברה הודית בנתה מערכת הפעלה רב-סוכנית AI, המורכבת מ-39 סוכנים מומחים, ללא שימוש בפריימוורק. המערכת, הנקראת Ira, משמשת כמוח החברה, ומטפלת במשימות עסקיות שונות, כגון מכירות, פיתוח עסקי, גיוס, וניהול.
06Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
07YT IndyDevDan · וידאו · מתקדם
GLM-5.2 ו-MiniMax-M3: תחרות אמיתית ל-Opus
GLM-5.2 ו-MiniMax-M3 הם מודלים חדשים שמתחרים ב-Opus. GLM-5.2 הוא המודל המוביל ב-Intelligence Index, ו-MiniMax-M3 הוא המודל הזול יותר. השניים מתחרים בביצועים ובמחיר.
08MarkTechPost · כתבה · מתקדם
DeepReinforce משחרר Ornith-1.0: משפחת מודלים קודים פתוחים
DeepReinforce השחררה את Ornith-1.0, משפחת מודלים פתוחים לקודים. המודלים מבוססים על Gemma 4 ו-Qwen 3.5. Ornith-1.0 לומדת לכתוב את הסקאפולד שלה בעצמה, והיא כוללת ארבעה גדלים: 9B, 31B, 35B-MoE ו-397B-MoE.
06

Fine-tuning

LoRA, QLoRA, full SFT — מתי, איך, ועם איזה כלים.

~5 שעותמתקדם
שיעור

כאשר אנו נדרשים להתאים מודל שפה גדול (LLM) למשימות ספציפיות, לעיצוב סגנון כתיבה ייחודי או להבנת דומיין מקצועי צר, שימוש ב-Prompt Engineering או RAG לא תמיד מספיק. כאן נכנס לתמונה תהליך ה-Fine-tuning (כוונון עדין). ברמת המתקדמים, אנו מבחינים בין שלוש גישות מרכזיות: Full Supervised Fine-Tuning (Full SFT), LoRA (Low-Rank Adaptation), ו-QLoRA (Quantized LoRA). הבנת ההבדלים ביניהן קריטית לניהול יעיל של משאבי מחשוב (Compute) וזמן ריצה.

שיטת Full SFT מעדכנת את כל המשקולות של המודל. היא מניבה את התוצאות המדויקות ביותר עבור שינויים התנהגותיים עמוקים, אך דורשת משאבי חומרה עצומים (מערכים מרובי GPUs). לעומתה, LoRA מקפיאה את משקולות המקור ומחדירה מטריצות קטנות ורזות (Low-Rank) לשכבות הצימוד (Attention), מה שמפחית את הזיכרון הנדרש באופן דרמטי. QLoRA לוקחת את זה צעד קדימה ומבצעת קוונטיזציה של מודל הבסיס ל-4-bit, מה שמאפשר להריץ Fine-tuning של מודלים ענקיים על גבי GPU צרכני בודד מבלי לפגוע כמעט בביצועים.

כדי ליישם את השיטות הללו בפועל, קהילת ה-Open Source מציעה שני כלים מובילים. הראשון הוא unsloth, ספרייה המאפשרת האצה של פי 2 במהירות וחיסכון של עד 80% בזיכרון ה-VRAM עבור מודלים פופולריים כמו Llama 3 ו-Mistral. הכלי השני הוא axolotl, פלטפורמה מבוססת קובצי קונפיגורציה (YAML) המיועדת לאימונים מבוזרים ומורכבים על גבי מספר כרטיסי מסך (Multi-GPU).

להלן דוגמה קצרה ופשוטה לשימוש ב-Unsloth לצורך טעינת מודל והכנתו ל-LoRA מהיר:

from unsloth import FastLanguageModel
import torch

max_seq_length = 2048
model, tokenizer = FastLanguageModel.from_pretrained(
    model_name = "unsloth/llama-3-8b-Instruct-bnb-4bit",
    max_seq_length = max_seq_length,
    load_in_4bit = True,
)

model = FastLanguageModel.get_peft_model(
    model,
    r = 16,
    target_modules = ["q_proj", "k_proj", "v_proj", "o_proj"],
    lora_alpha = 16,
    lora_dropout = 0,
    bias = "none",
)

לאחר שהמודל עבר התאמה אישית, הוא הופך ללב הפועם של מערכות מורכבות יותר. שילוב מודלים מותאמים אישית בתוך סוכני AI (Agents) מאפשר להשיג רמת ביצועים חסרת תקדים. כדי להבין כיצד לנהל את מחזור החיים של סוכנים אלו ולשמור על עקביות, מומלץ לקרוא על פיתוחים אחרונים בניהול State בגרסת LangGraph 1.2.1 או להעמיק בניהול זיכרון מתקדם עם langgraph-checkpoint 4.1.1. בנוסף, לדיון מרתק על האופן שבו מודלים מותאמים אישית מעצבים מחדש את תהליכי היצירה האנושיים, מומלץ לעיין במאמר הגברת יצירתיות בעידן ה-AI של MIT Tech Review.

הצעד הבא שלך: התחל בהרצת מחברת ה-Colab הרשמית של unsloth. בחר במודל Llama 3 8B, טען סט נתונים קטן משלך בפורמט Instruction (למשל, קובץ JSON פשוט המכיל שאלות ותשובות), והרץ אימון QLoRA מהיר בחינם. זה ייתן לך הבנה מעשית ראשונה של מהירות האימון וצריכת הזיכרון בפועל.

פרויקטי התחלה2 REPOS
unsloth
★ 22k
python מתקדם
Fine-tuning מהיר פי 2 וזיכרון פי 4 פחות. תומך LoRA/QLoRA/full SFT לכל המשפחות.
pip install unsloth
GitHub ↗
axolotl
★ 8k
python מתקדם
YAML-based fine-tuning, multi-GPU, distributed.
pip install axolotl
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
טוקנים צריכים עבודות
חוקרות מ-Anthropic מציעות לתת לטוקנים עבודות שונות, כגון ייעוץ או ציון, כדי לשפר ביצועים. הן מדגימות זאת על גבי משימות ניתוח פיננסי.
02YT Nate Herk · וידאו · בינוני
איך לבחור את ה- AI Agent הנכון
בחירת ה- AI Agent הנכון לצורכיו שלך. נקודות עיקריות: חיבור ל- Claude, גמיני ו- LangGraph, ועוד.
03Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.269: תיקונים ושיפורים
Claude v0.3.269: תיקונים ושיפורים במערכת ה-Claude. תוקנו בעיות ושופרו כמה תכונות במערכת.
04Ahead of AI · כתבה · מתקדם
GPT-6 Astra, מעגלי מתמטיקה וסיבות נסתרות
GPT-6 Astra הוא מודל חדש של OpenAI, המציג ביצועים מרשימים, במיוחד בתחומי 3D ואנימציה. המודל משתמש במעגלי מתמטיקה וטכניקות חדשות לשיפור הביצועים.
05Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.265: תיקונים ושיפורים
Claude v0.3.265: תיקונים ושיפורים במערכת. נוספו תכונות לסינתטיות ולפעילות של Claude Code.
06YT AI Engineer · וידאו · מתקדם
500 יכולות, אפס עדינות: ספר ההדרכה של LinkedIn לסוכנים AI
סוכני ה-AI של LinkedIn משתמשים ב-500 יכולות ללא עדינות. הם מסתמכים על חיפוש, השגת סכמה וביצוע, ומאפשרים לסוכנים למצוא מה שהם צריכים במקום לשאת הכל בהקשר. הדבר מאפשר פתרון תקלות בדקות במקום שעות.
07YT AI Engineer · וידאו · מתקדם
גבול הזיכרון של מודלים: עלייה עשרונית בשנה
לורי ווס, ראש יחסי מפתחים ב-Arize AI, בדק מחדש בנקודת ציון ישנה מלפני שנה ומצא כי המודלים החדישים עברו את הגבול הישן בלי להיתקל בו. הוא הראה כי הגבול עלה בעשרה מונים בשנה, וכיום נמצא ליד 2,000 הוראות, ואצל המודלים הטובים ביותר - ליד 5,000.
08Claude Agent SDK (ts) · כתבה · מתקדם
Claude Agent SDK v0.3.261
נוספו תכונות ל-Claude Agent SDK, כולל שליחת פלאג-אין ותיקון בעיות בקריאת query().
07

Fine-tuning

LoRA, QLoRA, full SFT — מתי, איך, ועם איזה כלים.

~5 שעותמתקדם
שיעור

כאשר אנו נדרשים להתאים מודל שפה גדול (LLM) למשימות ספציפיות, לעיצוב סגנון כתיבה ייחודי או להבנת דומיין מקצועי צר, שימוש ב-Prompt Engineering או RAG לא תמיד מספיק. כאן נכנס לתמונה תהליך ה-Fine-tuning (כוונון עדין). ברמת המתקדמים, אנו מבחינים בין שלוש גישות מרכזיות: Full Supervised Fine-Tuning (Full SFT), LoRA (Low-Rank Adaptation), ו-QLoRA (Quantized LoRA). הבנת ההבדלים ביניהן קריטית לניהול יעיל של משאבי מחשוב (Compute) וזמן ריצה.

שיטת Full SFT מעדכנת את כל המשקולות של המודל. היא מניבה את התוצאות המדויקות ביותר עבור שינויים התנהגותיים עמוקים, אך דורשת משאבי חומרה עצומים (מערכים מרובי GPUs). לעומתה, LoRA מקפיאה את משקולות המקור ומחדירה מטריצות קטנות ורזות (Low-Rank) לשכבות הצימוד (Attention), מה שמפחית את הזיכרון הנדרש באופן דרמטי. QLoRA לוקחת את זה צעד קדימה ומבצעת קוונטיזציה של מודל הבסיס ל-4-bit, מה שמאפשר להריץ Fine-tuning של מודלים ענקיים על גבי GPU צרכני בודד מבלי לפגוע כמעט בביצועים.

כדי ליישם את השיטות הללו בפועל, קהילת ה-Open Source מציעה שני כלים מובילים. הראשון הוא unsloth, ספרייה המאפשרת האצה של פי 2 במהירות וחיסכון של עד 80% בזיכרון ה-VRAM עבור מודלים פופולריים כמו Llama 3 ו-Mistral. הכלי השני הוא axolotl, פלטפורמה מבוססת קובצי קונפיגורציה (YAML) המיועדת לאימונים מבוזרים ומורכבים על גבי מספר כרטיסי מסך (Multi-GPU).

להלן דוגמה קצרה ופשוטה לשימוש ב-Unsloth לצורך טעינת מודל והכנתו ל-LoRA מהיר:

from unsloth import FastLanguageModel
import torch

max_seq_length = 2048
model, tokenizer = FastLanguageModel.from_pretrained(
    model_name = "unsloth/llama-3-8b-Instruct-bnb-4bit",
    max_seq_length = max_seq_length,
    load_in_4bit = True,
)

model = FastLanguageModel.get_peft_model(
    model,
    r = 16,
    target_modules = ["q_proj", "k_proj", "v_proj", "o_proj"],
    lora_alpha = 16,
    lora_dropout = 0,
    bias = "none",
)

לאחר שהמודל עבר התאמה אישית, הוא הופך ללב הפועם של מערכות מורכבות יותר. שילוב מודלים מותאמים אישית בתוך סוכני AI (Agents) מאפשר להשיג רמת ביצועים חסרת תקדים. כדי להבין כיצד לנהל את מחזור החיים של סוכנים אלו ולשמור על עקביות, מומלץ לקרוא על פיתוחים אחרונים בניהול State בגרסת LangGraph 1.2.1 או להעמיק בניהול זיכרון מתקדם עם langgraph-checkpoint 4.1.1. בנוסף, לדיון מרתק על האופן שבו מודלים מותאמים אישית מעצבים מחדש את תהליכי היצירה האנושיים, מומלץ לעיין במאמר הגברת יצירתיות בעידן ה-AI של MIT Tech Review.

הצעד הבא שלך: התחל בהרצת מחברת ה-Colab הרשמית של unsloth. בחר במודל Llama 3 8B, טען סט נתונים קטן משלך בפורמט Instruction (למשל, קובץ JSON פשוט המכיל שאלות ותשובות), והרץ אימון QLoRA מהיר בחינם. זה ייתן לך הבנה מעשית ראשונה של מהירות האימון וצריכת הזיכרון בפועל.

פרויקטי התחלה2 REPOS
unsloth
★ 22k
python מתקדם
Fine-tuning מהיר פי 2 וזיכרון פי 4 פחות. תומך LoRA/QLoRA/full SFT לכל המשפחות.
pip install unsloth
GitHub ↗
axolotl
★ 8k
python מתקדם
YAML-based fine-tuning, multi-GPU, distributed.
pip install axolotl
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
טוקנים צריכים עבודות
חוקרות מ-Anthropic מציעות לתת לטוקנים עבודות שונות, כגון ייעוץ או ציון, כדי לשפר ביצועים. הן מדגימות זאת על גבי משימות ניתוח פיננסי.
02YT Nate Herk · וידאו · בינוני
איך לבחור את ה- AI Agent הנכון
בחירת ה- AI Agent הנכון לצורכיו שלך. נקודות עיקריות: חיבור ל- Claude, גמיני ו- LangGraph, ועוד.
03Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.269: תיקונים ושיפורים
Claude v0.3.269: תיקונים ושיפורים במערכת ה-Claude. תוקנו בעיות ושופרו כמה תכונות במערכת.
04Ahead of AI · כתבה · מתקדם
GPT-6 Astra, מעגלי מתמטיקה וסיבות נסתרות
GPT-6 Astra הוא מודל חדש של OpenAI, המציג ביצועים מרשימים, במיוחד בתחומי 3D ואנימציה. המודל משתמש במעגלי מתמטיקה וטכניקות חדשות לשיפור הביצועים.
05Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.265: תיקונים ושיפורים
Claude v0.3.265: תיקונים ושיפורים במערכת. נוספו תכונות לסינתטיות ולפעילות של Claude Code.
06YT AI Engineer · וידאו · מתקדם
500 יכולות, אפס עדינות: ספר ההדרכה של LinkedIn לסוכנים AI
סוכני ה-AI של LinkedIn משתמשים ב-500 יכולות ללא עדינות. הם מסתמכים על חיפוש, השגת סכמה וביצוע, ומאפשרים לסוכנים למצוא מה שהם צריכים במקום לשאת הכל בהקשר. הדבר מאפשר פתרון תקלות בדקות במקום שעות.
07YT AI Engineer · וידאו · מתקדם
גבול הזיכרון של מודלים: עלייה עשרונית בשנה
לורי ווס, ראש יחסי מפתחים ב-Arize AI, בדק מחדש בנקודת ציון ישנה מלפני שנה ומצא כי המודלים החדישים עברו את הגבול הישן בלי להיתקל בו. הוא הראה כי הגבול עלה בעשרה מונים בשנה, וכיום נמצא ליד 2,000 הוראות, ואצל המודלים הטובים ביותר - ליד 5,000.
08Claude Agent SDK (ts) · כתבה · מתקדם
Claude Agent SDK v0.3.261
נוספו תכונות ל-Claude Agent SDK, כולל שליחת פלאג-אין ותיקון בעיות בקריאת query().
08

Inference: vLLM / TGI

הרצה מקומית או על שרת — throughput, batching, quantization.

~4 שעותמתקדם
שיעור

כשמדובר בפריסה של מודלי שפה גדולים (LLMs) בסביבת ייצור (Production), הרצה פשוטה באמצעות ספריות כמו transformers של Hugging Face כבר אינה מספיקה. כאן נכנסים לתמונה מנועי Inference מתקדמים כמו vLLM ו-TGI (Text Generation Inference). מנועים אלו תוכננו במיוחד כדי למקסם את ה-throughput (קצב הפקת הטוקנים) ולמזער את ה-latency (זמן התגובה) על ידי אופטימיזציות ברמת החומרה והזיכרון.

מדוע אנו זקוקים להם? האתגר הגדול ביותר בהרצת LLMs הוא ניהול זיכרון ה-KV Cache (מפתח-ערך) של המודל. טכנולוגיית PagedAttention, שהוצגה לראשונה ב-vLLM, פותרת את בעיית הפרגמנטציה של הזיכרון על ידי חלוקתו לדפים דינמיים, בדומה לניהול זיכרון וירטואלי במערכות הפעלה. בנוסף, מנגנון ה-Continuous Batching (או In-flight Batching) מאפשר להכניס בקשות חדשות ל-batch הקיים בזמן אמת מבלי להמתין שכל הבקשות הקודמות יסתיימו, מה שמעלה את הניצולת של ה-GPU במאות אחוזים.

כדי להריץ מודלים ענקיים על חומרה מוגבלת, מנועים אלו תומכים בטכניקות דחיסה וקוונטיזציה (Quantization) מתקדמות כמו AWQ, GPTQ ו-FP8. שימוש בפורמטים אלו מאפשר להקטין את נפח המודל בזיכרון ה-VRAM כמעט ללא פגיעה בדיוק הכללי של המודל. בחירה בפתרון כמו vLLM מאפשרת גם חשיפה קלה של השרת כ-API התואם לחלוטין ל-OpenAI, מה שמקל על אינטגרציה מהירה עם ספריות קיימות.

הנה דוגמה קצרה ופשוטה להרצת מודל מקומי באמצעות vLLM וכתיבת קוד Python מהיר להפקת טקסט:

from vllm import LLM, SamplingParams

# טעינת המודל עם תמיכה ב-PagedAttention באופן אוטומטי
llm = LLM(model="facebook/opt-125m")

# הגדרת פרמטרים להפקה
sampling_params = SamplingParams(temperature=0.8, top_p=0.95, max_tokens=50)

# הרצת ה-Inference על מספר פרומפטים במקביל (Batching)
prompts = ["Hello, my name is", "The capital of France is"]
outputs = llm.generate(prompts, sampling_params)

for output in outputs:
    print(f"Prompt: {output.prompt!r} -> Generated: {output.outputs[0].text!r}")

המעבר לעבודה עם מנועי הסקה יעילים כמו vLLM ו-TGI הוא קריטי במיוחד כאשר דנים במגמות של מודלים פתוחים מול סגורים, כפי שמתואר בפודקאסט האגדה על מלחמות המודלים: פתוח vs סגור ב-2026. בנוסף, חברות רבות מעבירות את עומסי העבודה שלהן לעננים ייעודיים (Neoclouds) כדי לחסוך בעלויות ה-GPU, נושא שעולה לדיון בפרק המיית של Mythos ו-Allbirds טוען לטיסה ל-neocloud.

הצעד הבא שלך: התקן את vLLM על שרת עם GPU (או ב-Google Colab עם כרטיס T4/A100). הרץ את השרת כ-API תואם OpenAI באמצעות הפקודה הבאה:

python -m vllm.entrypoints.openai.api_server --model facebook/opt-125m

לאחר מכן, שלח בקשת POST פשוטה באמצעות curl או ספריית openai הרשמית ובדוק את מהירות התגובה (Tokens per second) בהשוואה להרצה רגילה.

פרויקטי התחלה1 REPOS
vLLM
★ 35k
python מתקדם
הinference engine המוביל לפרודקשן — PagedAttention, continuous batching, OpenAI-compatible API.
pip install vllm && vllm serve meta-llama/Llama-3.3-70B-Instruct
GitHub ↗
חומרי קריאה8 פריטים
01Vercel AI SDK · כתבה · מתקדם
פיצ' זי: @ai-sdk/zai@3.0.10
נערכו תלותיות ב@ai-sdk/zai@3.0.10
02Vercel AI SDK · כתבה · מתקדם
XAI 4.0.58: תיקון תמיכה לבקשות קבוצה לא תואמות
XAI 4.0.58: תיקון לבקשות קבוצה לא תואמות. התוסף תומך כעת בבקשות ייצור תמונות בקבוצות.
03Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/tui@1.0.99
עודכן תלותיות ב @ai-sdk/tui לגרסה 1.0.99. העדכון כולל עדכון של תלותיות באי-סדק.
04LangChain releases · כתבה · מתקדם
langchain-openai==1.6.2
langchain-openai==1.6.2: הוספת ניסיונות תגובה של GPT-6 Astra
05YT Nate Herk · וידאו · כללי
תודה ל-1,000,000 מנויים
יוצר יוצא ל-1,000,000 מנויים, 2 שנים לאחר שפרסם את הסרטון הראשון שלו. הוא תודה לקהל שלו ולכל האנשים שעזרו לו להגיע למאזן הזה.
06Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/zai@3.0.7
עודכן תלותיות @ai-sdk/zai@3.0.7, כולל @ai-sdk/provider@4.0.11, @ai-sdk/provider-utils@5.0.37 ו@ai-sdk/openai-compatible@3.0.45
07Vercel AI SDK · כתבה · מתקדם
XAI 4.0.55: תמיכה במודלים לפי בקשה ב batch
XAI 4.0.55 תומכת במודלים לפי בקשה ב batch. נעשו גם עדכוני תלות.
08Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/workflow@2.0.25
עודכן תלותיות ב @ai-sdk/workflow@2.0.25. עודכן ai@7.0.94, @ai-sdk/provider@4.0.11 ו-@ai-sdk/provider-utils@5.0.37.
09

Inference: vLLM / TGI

הרצה מקומית או על שרת — throughput, batching, quantization.

~4 שעותמתקדם
שיעור

כשמדובר בפריסה של מודלי שפה גדולים (LLMs) בסביבת ייצור (Production), הרצה פשוטה באמצעות ספריות כמו transformers של Hugging Face כבר אינה מספיקה. כאן נכנסים לתמונה מנועי Inference מתקדמים כמו vLLM ו-TGI (Text Generation Inference). מנועים אלו תוכננו במיוחד כדי למקסם את ה-throughput (קצב הפקת הטוקנים) ולמזער את ה-latency (זמן התגובה) על ידי אופטימיזציות ברמת החומרה והזיכרון.

מדוע אנו זקוקים להם? האתגר הגדול ביותר בהרצת LLMs הוא ניהול זיכרון ה-KV Cache (מפתח-ערך) של המודל. טכנולוגיית PagedAttention, שהוצגה לראשונה ב-vLLM, פותרת את בעיית הפרגמנטציה של הזיכרון על ידי חלוקתו לדפים דינמיים, בדומה לניהול זיכרון וירטואלי במערכות הפעלה. בנוסף, מנגנון ה-Continuous Batching (או In-flight Batching) מאפשר להכניס בקשות חדשות ל-batch הקיים בזמן אמת מבלי להמתין שכל הבקשות הקודמות יסתיימו, מה שמעלה את הניצולת של ה-GPU במאות אחוזים.

כדי להריץ מודלים ענקיים על חומרה מוגבלת, מנועים אלו תומכים בטכניקות דחיסה וקוונטיזציה (Quantization) מתקדמות כמו AWQ, GPTQ ו-FP8. שימוש בפורמטים אלו מאפשר להקטין את נפח המודל בזיכרון ה-VRAM כמעט ללא פגיעה בדיוק הכללי של המודל. בחירה בפתרון כמו vLLM מאפשרת גם חשיפה קלה של השרת כ-API התואם לחלוטין ל-OpenAI, מה שמקל על אינטגרציה מהירה עם ספריות קיימות.

הנה דוגמה קצרה ופשוטה להרצת מודל מקומי באמצעות vLLM וכתיבת קוד Python מהיר להפקת טקסט:

from vllm import LLM, SamplingParams

# טעינת המודל עם תמיכה ב-PagedAttention באופן אוטומטי
llm = LLM(model="facebook/opt-125m")

# הגדרת פרמטרים להפקה
sampling_params = SamplingParams(temperature=0.8, top_p=0.95, max_tokens=50)

# הרצת ה-Inference על מספר פרומפטים במקביל (Batching)
prompts = ["Hello, my name is", "The capital of France is"]
outputs = llm.generate(prompts, sampling_params)

for output in outputs:
    print(f"Prompt: {output.prompt!r} -> Generated: {output.outputs[0].text!r}")

המעבר לעבודה עם מנועי הסקה יעילים כמו vLLM ו-TGI הוא קריטי במיוחד כאשר דנים במגמות של מודלים פתוחים מול סגורים, כפי שמתואר בפודקאסט האגדה על מלחמות המודלים: פתוח vs סגור ב-2026. בנוסף, חברות רבות מעבירות את עומסי העבודה שלהן לעננים ייעודיים (Neoclouds) כדי לחסוך בעלויות ה-GPU, נושא שעולה לדיון בפרק המיית של Mythos ו-Allbirds טוען לטיסה ל-neocloud.

הצעד הבא שלך: התקן את vLLM על שרת עם GPU (או ב-Google Colab עם כרטיס T4/A100). הרץ את השרת כ-API תואם OpenAI באמצעות הפקודה הבאה:

python -m vllm.entrypoints.openai.api_server --model facebook/opt-125m

לאחר מכן, שלח בקשת POST פשוטה באמצעות curl או ספריית openai הרשמית ובדוק את מהירות התגובה (Tokens per second) בהשוואה להרצה רגילה.

פרויקטי התחלה1 REPOS
vLLM
★ 35k
python מתקדם
הinference engine המוביל לפרודקשן — PagedAttention, continuous batching, OpenAI-compatible API.
pip install vllm && vllm serve meta-llama/Llama-3.3-70B-Instruct
GitHub ↗
חומרי קריאה8 פריטים
01Vercel AI SDK · כתבה · מתקדם
פיצ' זי: @ai-sdk/zai@3.0.10
נערכו תלותיות ב@ai-sdk/zai@3.0.10
02Vercel AI SDK · כתבה · מתקדם
XAI 4.0.58: תיקון תמיכה לבקשות קבוצה לא תואמות
XAI 4.0.58: תיקון לבקשות קבוצה לא תואמות. התוסף תומך כעת בבקשות ייצור תמונות בקבוצות.
03Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/tui@1.0.99
עודכן תלותיות ב @ai-sdk/tui לגרסה 1.0.99. העדכון כולל עדכון של תלותיות באי-סדק.
04LangChain releases · כתבה · מתקדם
langchain-openai==1.6.2
langchain-openai==1.6.2: הוספת ניסיונות תגובה של GPT-6 Astra
05YT Nate Herk · וידאו · כללי
תודה ל-1,000,000 מנויים
יוצר יוצא ל-1,000,000 מנויים, 2 שנים לאחר שפרסם את הסרטון הראשון שלו. הוא תודה לקהל שלו ולכל האנשים שעזרו לו להגיע למאזן הזה.
06Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/zai@3.0.7
עודכן תלותיות @ai-sdk/zai@3.0.7, כולל @ai-sdk/provider@4.0.11, @ai-sdk/provider-utils@5.0.37 ו@ai-sdk/openai-compatible@3.0.45
07Vercel AI SDK · כתבה · מתקדם
XAI 4.0.55: תמיכה במודלים לפי בקשה ב batch
XAI 4.0.55 תומכת במודלים לפי בקשה ב batch. נעשו גם עדכוני תלות.
08Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/workflow@2.0.25
עודכן תלותיות ב @ai-sdk/workflow@2.0.25. עודכן ai@7.0.94, @ai-sdk/provider@4.0.11 ו-@ai-sdk/provider-utils@5.0.37.
10

Leaderboards + benchmarks

LMArena, Open LLM Leaderboard, ArtificialAnalysis.

~2 שעותבינוני
שיעור

בעולם ה-AI המתפתח במהירות מסחררת, בחירת מודל השפה (LLM) המתאים ביותר למשימה שלכם היא אתגר מורכב. כאן נכנסים לתמונה לוחות מובילים (Leaderboards) ומבחני ביצועים (Benchmarks). כלים אלו מספקים מדדים אובייקטיביים והשוואתיים בין עשרות ומאות מודלים שונים. שלושת הכלים המובילים כיום בתחום הם LMSYS Chatbot Arena (LMArena) המבוסס על דירוג אנושי עיוור (Elo rating), ה-Open LLM Leaderboard של Hugging Face המתמקד במבחנים אקדמיים פתוחים, ו-ArtificialAnalysis המספק ניתוח מעמיק של מהירות, עלות וביצועים בזמן אמת.

הבנת הכלים הללו קריטית עבור מפתחים וארכיטקטים של פתרונות AI. במקום להסתמך על הבטחות שיווקיות של חברות הענק, מדדים אלו מאפשרים לכם לקבל החלטות מבוססות נתונים. לדוגמה, אם האפליקציה שלכם דורשת זמני תגובה מהירים במיוחד (Latency נמוך) ועלויות נמוכות, תרצו לבדוק את הנתונים ב-ArtificialAnalysis. לעומת זאת, אם אתם מחפשים מודל שמבין ניואנסים אנושיים בצורה הטובה ביותר, הדירוג ב-LMArena הוא המקור המהימן ביותר כיוון שהוא מבוסס על אלפי השוואות "ראש בראש" של משתמשים אמיתיים.

מעבר להסתמכות על לוחות ציבוריים, לעיתים קרובות תרצו להריץ מבחני ביצועים (benchmarks) מותאמים אישית על המודלים שלכם או על משימות ספציפיות לארגון שלכם. הכלי המוביל בתעשייה למטרה זו הוא lm-evaluation-harness של EleutherAI. כלי זה מאפשר להריץ מאות מבחנים סטנדרטיים (כמו MMLU, GSM8k ועוד) על כל מודל מקומי או מרוחק בצורה פשוטה ומהירה, ובכך לייצר "לוח מובילים" פנימי משלכם.

כדי להתחיל להשתמש ב-lm-evaluation-harness באופן מקומי, ניתן להריץ פקודה פשוטה מהטרמינל כדי להעריך מודל (למשל מודל של Hugging Face) על משימה ספציפית:

# התקנת הכלי
pip install lm-eval

# הרצת הערכה למודל Llama-3 על משימת MMLU
lm_eval --model hf \
    --model_args pretrained=meta-llama/Meta-Llama-3-8B \
    --tasks mmlu \
    --device cuda:0 \
    --batch_size 8

כאשר בונים מערכות AI מורכבות, כלי הערכה משתלבים ישירות בתוך ספריות הפיתוח. לדוגמה, בגרסאות האחרונות של DSPy 3.2.0 ו-DSPy 3.1.0, מושם דגש רב על אופטימיזציה והערכה אוטומטית של פרומפטים ומודלים (Assertions & Suggestions). שילוב של ספריות אלו יחד עם מתודולוגיות הערכה מובנות מאפשר לשפר את דיוק המודל בצורה שיטתית ומדידה, בדומה לתהליכי בדיקות תוכנה מסורתיים (CI/CD).

הצעד הבא שלכם: התקינו את פרויקט הקוד lm-evaluation-harness והריצו הערכה בסיסית על מודל קטן ופתוח (כמו Qwen/Qwen2.5-1.5B-Instruct) באמצעות משימת הערכה פשוטה כמו arc_challenge או hellaswag. השוו את התוצאות שקיבלתם לדירוג הרשמי ב-Open LLM Leaderboard כדי להבין כיצד המדדים מתנהגים בפועל.

פרויקטי התחלה1 REPOS
lm-evaluation-harness
★ 8k
python מתקדם
הכלי שעומד מאחורי Open LLM Leaderboard. הרץ benchmarks משלך.
pip install lm-eval && lm_eval --tasks hellaswag
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
הנדסת רתמה: בניית כלוב הייצור לסוכנים חזקים
מייק צ'יימברס, מפתח ומומחה AI ב-AWS, מסביר על הנדסת רתמה, שהיא בניית כלוב ייצור לסוכנים חזקים. הוא מדגים כיצד לבנות סוכן עם כלים וניהול מידע, ומדגיש את חשיבות הרתמה בפיתוח סוכנים.
02YT IndyDevDan · וידאו · מתקדם
דירוג מהנדסי סוכנים: איך אני מדרג Astra, Fable 5.1 ו-Open-Weights
דירוג מהנדסי סוכנים מושווה את GPT-6 Astra, Claude Fable 5.1 והשדה הפתוח של Open-Weights. הדירוג מבוסס על חמישה בנצ'מרקים: Terminal-Bench v4.0, APEX Agents Leaderboard, AutomationBench, AA-Omniscience ו-DeepSWE v1.1. הדירוג בוחן את הביצועים, העלות והמהירות של כל מודל.
03YT AI Engineer · וידאו · מתקדם
כלי פיתוח לעומת זמן ריצה
אברי קיטש ופרנה קאקר מגוגל מדגימים כישלון של כלי פיתוח בזמן ריצה. הם מציגים כיצד סוכנים יכולים לגרום לתקלות בזמן ריצה. הם מציעים פתרונות לבעיה זו, כולל הפרדה בין זהות משתמש, אפליקציה וסוכן.
04YT AI Engineer · וידאו · מתקדם
גבול הזיכרון של מודלים: עלייה עשרונית בשנה
לורי ווס, ראש יחסי מפתחים ב-Arize AI, בדק מחדש בנקודת ציון ישנה מלפני שנה ומצא כי המודלים החדישים עברו את הגבול הישן בלי להיתקל בו. הוא הראה כי הגבול עלה בעשרה מונים בשנה, וכיום נמצא ליד 2,000 הוראות, ואצל המודלים הטובים ביותר - ליד 5,000.
05YT AI Engineer · וידאו · בינוני
מדדים לאימון AI
חברת Ironclad בנתה דשבורד למעקב אחר שימוש בטוקנים של AI. המהנדס Mingsheng Hong מדגים כיצד לא לעשות זאת, ומציג את הגישה של 'trusted throughput' - עבודה שעוברת בדיקות אובייקטיביות, ביקורת אנושית ומגע עם לקוחות.
06YT AI Engineer · וידאו · מתקדם
חצי חיים של תשתית סוכנים
בן קוס מ-Ben Kus מ-Box דן בחצי חיים הקצר של תשתית סוכנים. הוא טוען כי תשתית סוכנים משנה עצמה בתדירות גבוהה, ולכן יש להיות מוכנים לשינוי. הוא ממליץ לבנות אבסטרקציות שמאפשרות החלפה קלה של שכבות תשתית.
07YT AI Engineer · וידאו · מתקדם
בניית המנוע בעת שטסים: השקת שרת MCP של Figma — Jesse Lumarie, Figma
שרת MCP של Figma נבנה כפרויקט 20%, על אף שהחברה לא הייתה ידועה בפרויקטים 20%. הוא הפך לאחד מהמוצרים המהירים ביותר ש-Figma שילחה לשוק. הפרויקט כלל שימוש במודלי Gemini ובכלים כמו React ו-Tailwind. השרת MCP של Figma הציע פתרון לבעיית האספקטיביות של המודלים, ואפשר למפתחים להשתמש בו כדי לפתח אפליקציות חדשות. הפרויקט הציג גם חידושים בתחום האינטראקציה עם המודלים, כמו שימוש בפונקציות של React ובכלים כמו Tailwind.
08YT AI Engineer · וידאו · מתקדם
ניתוב מודלים: הבחירה הנכונה
ניתוב מודלים הוא שיטה לבחירת המודל הנכון למשימה ספציפית. Archana Kamath ו-Tyler Gillam מ-DigitalOcean הדגימו כיצד ניתוב מודלים יכול לחסוך עלויות ולשפר ביצועים. הם השתמשו במודל מומחים מותאם לקבלת החלטות בפחות מ-200 מילישניות.
11

Leaderboards + benchmarks

LMArena, Open LLM Leaderboard, ArtificialAnalysis.

~2 שעותבינוני
שיעור

בעולם ה-AI המתפתח במהירות מסחררת, בחירת מודל השפה (LLM) המתאים ביותר למשימה שלכם היא אתגר מורכב. כאן נכנסים לתמונה לוחות מובילים (Leaderboards) ומבחני ביצועים (Benchmarks). כלים אלו מספקים מדדים אובייקטיביים והשוואתיים בין עשרות ומאות מודלים שונים. שלושת הכלים המובילים כיום בתחום הם LMSYS Chatbot Arena (LMArena) המבוסס על דירוג אנושי עיוור (Elo rating), ה-Open LLM Leaderboard של Hugging Face המתמקד במבחנים אקדמיים פתוחים, ו-ArtificialAnalysis המספק ניתוח מעמיק של מהירות, עלות וביצועים בזמן אמת.

הבנת הכלים הללו קריטית עבור מפתחים וארכיטקטים של פתרונות AI. במקום להסתמך על הבטחות שיווקיות של חברות הענק, מדדים אלו מאפשרים לכם לקבל החלטות מבוססות נתונים. לדוגמה, אם האפליקציה שלכם דורשת זמני תגובה מהירים במיוחד (Latency נמוך) ועלויות נמוכות, תרצו לבדוק את הנתונים ב-ArtificialAnalysis. לעומת זאת, אם אתם מחפשים מודל שמבין ניואנסים אנושיים בצורה הטובה ביותר, הדירוג ב-LMArena הוא המקור המהימן ביותר כיוון שהוא מבוסס על אלפי השוואות "ראש בראש" של משתמשים אמיתיים.

מעבר להסתמכות על לוחות ציבוריים, לעיתים קרובות תרצו להריץ מבחני ביצועים (benchmarks) מותאמים אישית על המודלים שלכם או על משימות ספציפיות לארגון שלכם. הכלי המוביל בתעשייה למטרה זו הוא lm-evaluation-harness של EleutherAI. כלי זה מאפשר להריץ מאות מבחנים סטנדרטיים (כמו MMLU, GSM8k ועוד) על כל מודל מקומי או מרוחק בצורה פשוטה ומהירה, ובכך לייצר "לוח מובילים" פנימי משלכם.

כדי להתחיל להשתמש ב-lm-evaluation-harness באופן מקומי, ניתן להריץ פקודה פשוטה מהטרמינל כדי להעריך מודל (למשל מודל של Hugging Face) על משימה ספציפית:

# התקנת הכלי
pip install lm-eval

# הרצת הערכה למודל Llama-3 על משימת MMLU
lm_eval --model hf \
    --model_args pretrained=meta-llama/Meta-Llama-3-8B \
    --tasks mmlu \
    --device cuda:0 \
    --batch_size 8

כאשר בונים מערכות AI מורכבות, כלי הערכה משתלבים ישירות בתוך ספריות הפיתוח. לדוגמה, בגרסאות האחרונות של DSPy 3.2.0 ו-DSPy 3.1.0, מושם דגש רב על אופטימיזציה והערכה אוטומטית של פרומפטים ומודלים (Assertions & Suggestions). שילוב של ספריות אלו יחד עם מתודולוגיות הערכה מובנות מאפשר לשפר את דיוק המודל בצורה שיטתית ומדידה, בדומה לתהליכי בדיקות תוכנה מסורתיים (CI/CD).

הצעד הבא שלכם: התקינו את פרויקט הקוד lm-evaluation-harness והריצו הערכה בסיסית על מודל קטן ופתוח (כמו Qwen/Qwen2.5-1.5B-Instruct) באמצעות משימת הערכה פשוטה כמו arc_challenge או hellaswag. השוו את התוצאות שקיבלתם לדירוג הרשמי ב-Open LLM Leaderboard כדי להבין כיצד המדדים מתנהגים בפועל.

פרויקטי התחלה1 REPOS
lm-evaluation-harness
★ 8k
python מתקדם
הכלי שעומד מאחורי Open LLM Leaderboard. הרץ benchmarks משלך.
pip install lm-eval && lm_eval --tasks hellaswag
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
הנדסת רתמה: בניית כלוב הייצור לסוכנים חזקים
מייק צ'יימברס, מפתח ומומחה AI ב-AWS, מסביר על הנדסת רתמה, שהיא בניית כלוב ייצור לסוכנים חזקים. הוא מדגים כיצד לבנות סוכן עם כלים וניהול מידע, ומדגיש את חשיבות הרתמה בפיתוח סוכנים.
02YT IndyDevDan · וידאו · מתקדם
דירוג מהנדסי סוכנים: איך אני מדרג Astra, Fable 5.1 ו-Open-Weights
דירוג מהנדסי סוכנים מושווה את GPT-6 Astra, Claude Fable 5.1 והשדה הפתוח של Open-Weights. הדירוג מבוסס על חמישה בנצ'מרקים: Terminal-Bench v4.0, APEX Agents Leaderboard, AutomationBench, AA-Omniscience ו-DeepSWE v1.1. הדירוג בוחן את הביצועים, העלות והמהירות של כל מודל.
03YT AI Engineer · וידאו · מתקדם
כלי פיתוח לעומת זמן ריצה
אברי קיטש ופרנה קאקר מגוגל מדגימים כישלון של כלי פיתוח בזמן ריצה. הם מציגים כיצד סוכנים יכולים לגרום לתקלות בזמן ריצה. הם מציעים פתרונות לבעיה זו, כולל הפרדה בין זהות משתמש, אפליקציה וסוכן.
04YT AI Engineer · וידאו · מתקדם
גבול הזיכרון של מודלים: עלייה עשרונית בשנה
לורי ווס, ראש יחסי מפתחים ב-Arize AI, בדק מחדש בנקודת ציון ישנה מלפני שנה ומצא כי המודלים החדישים עברו את הגבול הישן בלי להיתקל בו. הוא הראה כי הגבול עלה בעשרה מונים בשנה, וכיום נמצא ליד 2,000 הוראות, ואצל המודלים הטובים ביותר - ליד 5,000.
05YT AI Engineer · וידאו · בינוני
מדדים לאימון AI
חברת Ironclad בנתה דשבורד למעקב אחר שימוש בטוקנים של AI. המהנדס Mingsheng Hong מדגים כיצד לא לעשות זאת, ומציג את הגישה של 'trusted throughput' - עבודה שעוברת בדיקות אובייקטיביות, ביקורת אנושית ומגע עם לקוחות.
06YT AI Engineer · וידאו · מתקדם
חצי חיים של תשתית סוכנים
בן קוס מ-Ben Kus מ-Box דן בחצי חיים הקצר של תשתית סוכנים. הוא טוען כי תשתית סוכנים משנה עצמה בתדירות גבוהה, ולכן יש להיות מוכנים לשינוי. הוא ממליץ לבנות אבסטרקציות שמאפשרות החלפה קלה של שכבות תשתית.
07YT AI Engineer · וידאו · מתקדם
בניית המנוע בעת שטסים: השקת שרת MCP של Figma — Jesse Lumarie, Figma
שרת MCP של Figma נבנה כפרויקט 20%, על אף שהחברה לא הייתה ידועה בפרויקטים 20%. הוא הפך לאחד מהמוצרים המהירים ביותר ש-Figma שילחה לשוק. הפרויקט כלל שימוש במודלי Gemini ובכלים כמו React ו-Tailwind. השרת MCP של Figma הציע פתרון לבעיית האספקטיביות של המודלים, ואפשר למפתחים להשתמש בו כדי לפתח אפליקציות חדשות. הפרויקט הציג גם חידושים בתחום האינטראקציה עם המודלים, כמו שימוש בפונקציות של React ובכלים כמו Tailwind.
08YT AI Engineer · וידאו · מתקדם
ניתוב מודלים: הבחירה הנכונה
ניתוב מודלים הוא שיטה לבחירת המודל הנכון למשימה ספציפית. Archana Kamath ו-Tyler Gillam מ-DigitalOcean הדגימו כיצד ניתוב מודלים יכול לחסוך עלויות ולשפר ביצועים. הם השתמשו במודל מומחים מותאם לקבלת החלטות בפחות מ-200 מילישניות.
12

מודלים רב-מודאליים open-source

Llama Vision, Qwen-VL, PaliGemma — איך מודלי שפה רואים תמונות, וידאו, אודיו.

~4 שעותמתקדם
שיעור

בעולם ה-AI המודרני, מודלים של שפה כבר אינם מוגבלים לטקסט בלבד. מודלים רב-מודאליים (Multimodal Models) בקוד פתוח, כדוגמת Llama 3.2 Vision, Qwen-VL ו-PaliGemma, חוללו מהפכה בכך שהם מאפשרים ל-LLM "לראות" תמונות ווידאו, ואף להבין אודיו באותה רשת נוירונים. פריצת הדרך הזו מתאפשרת על ידי חיבור של Vision Encoder (כמו CLIP או SigLIP) ישירות אל ה-Backbone של מודל השפה באמצעות שכבת קישור (Projection Layer) המתרגמת את הפיצ'רים הוויזואליים לטוקנים שהמודל מסוגל לעבד.

המעבר למודלים רב-מודאליים בקוד פתוח (Open-Source) הוא קריטי עבור ארגונים ומפתחים המעוניינים בפרטיות מידע מלאה, התאמה אישית (Fine-tuning) על דאטה ייחודי, ומניעת עלויות API גבוהות של מודלים סגורים. שימוש במודלים אלו נפוץ במיוחד במערכות RAG מתקדמות המשלבות מסמכים סרוקים, ניתוח אוטומטי של תרשימים רפואיים, פענוח קבלות (OCR מתקדם), ואפילו ניתוח בזמן אמת של מצלמות אבטחה ווידאו.

כדי לבנות יישומים מורכבים המשלבים ראייה ממוחשבת ושפה, אנו נעזרים בפריימוורקים מובילים לניהול קונטקסט. עדכונים אחרונים כמו LlamaIndex v0.14.15 וכן llama-index-core 0.14.16 מציגים שיפורים משמעותיים בתמיכה במודלי Vision, המאפשרים שליפת מידע מדויקת מתוך תמונות ומסמכים מרובי עמודים (Multi-modal RAG).

להלן דוגמה קונקרטית לטעינה והרצה של מודל Qwen-VL לניתוח תמונה באמצעות ספריית transformers של Hugging Face:

from transformers import Qwen2VLForConditionalGeneration, AutoProcessor
from PIL import Image

# טעינת המודל והמעבד המתאים
model = Qwen2VLForConditionalGeneration.from_pretrained("Qwen/Qwen2-VL-7B-Instruct", torch_dtype="auto", device_map="auto")
processor = AutoProcessor.from_pretrained("Qwen/Qwen2-VL-7B-Instruct")

image = Image.open("invoice.jpg")
messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "Extract the total amount and tax from this invoice."}]}]
text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = processor(text=[text], images=[image], padding=True, return_tensors="pt").to("cuda")

generated_ids = model.generate(**inputs, max_new_tokens=128)
print(processor.batch_decode(generated_ids, skip_special_tokens=True))

מעבר לניתוח טכני יבש, השילוב של יכולות ראייה פותח אפיקים חדשים של יצירתיות ופיתוח ממשקים אינטראקטיביים. כפי שמתואר במאמר על הגברת יצירתיות בעידן ה-AI מבית MIT Tech Review, השילוב של קלט ויזואלי מאפשר ליוצרים ומפתחים לעבוד בצורה אינטואיטיבית יותר, שבה המודל מבין סקיצות ידניות, עיצובי ממשק משתמש (UI) או תרשימי זרימה והופך אותם לקוד פרודקשן או ליצירות אמנות חדשות.

הצעד הבא שלכם: פרויקט הסטארטר המומלץ ביותר להתחלה הוא שימוש ב- LLaVA או ב- Qwen-VL. הורידו את אחד המודלים הללו באופן מקומי (למשל באמצעות Ollama או Hugging Face), והקימו יישום קטן שמקבל קובץ PDF סרוק ומפיק ממנו קובץ JSON מובנה המכיל את כל הנתונים החשובים מתוך הטבלאות והגרפים שבו.

פרויקטי התחלה2 REPOS
LLaVA
★ 21k
python מתקדם
מודל ה-vision-language open-source הראשון שהיה תחרותי מול GPT-4V. ארכיטקטורה ברורה, קל לאימון.
git clone https://github.com/haotian-liu/LLaVA && pip install -e .
GitHub ↗
Qwen-VL
★ 5.5k
python מתקדם
משפחת המודלים הוויזואליים של Alibaba — מובילה ב-benchmarks. תומכת תמונות, וידאו, OCR.
pip install transformers accelerate
GitHub ↗
חומרי קריאה8 פריטים
01MarkTechPost · כתבה · מתקדם
H Company משחררת NeoMME: משפחה של 260M ו-800M Single-Tower Multimodal Encoders
H Company השיקה NeoMME, משפחה של 260M ו-800M Single-Tower Multimodal Encoders שמשימתם לקצץ בפרמטרים ובחישוב.
02YT AI Engineer · וידאו · מתקדם
פאנל: תצורה על-שורה של מדיה יוצרת
צוות Google DeepMind דנה בפאנל על-שורה של תצורה יוצרת. הם דנו בקשר בין תצורה יוצרת לבין חידושים בתחום האינטרפטציה של האדם. הם גם דנו בקשר בין תצורה יוצרת לבין חידושים בתחום האינטרפטציה של האדם.
03YT AI Engineer · וידאו · מתקדם
הבאת סוכנים לרשת האינטרנט
פול קליין הרביעי מדבר על הבאת סוכנים לרשת האינטרנט. הוא טוען שהיכולת כבר קיימת, אך ההנדסה סביבה חסרה. סוכנים רב-מודאליים יכולים לכתוב קוד לצד לחיצות עכבר, ולהשתמש בתשתית שמנדרינה דפים באופן זהה.
04YT AI Engineer · וידאו · מתקדם
מצב הנתיביות של המודלים — NVIDIA, Cognition, OpenRouter
NVIDIA, Cognition ו-OpenRouter דנים בנתיביות מודלים. הם משווים ביצועים ועלות של מודלים שונים, ומציעים פתרונות לשיפור היעילות. הדיון כולל השוואה בין Opus ו-Haiku, והצגת גישות חדשות לניהול מודלים.
05MarkTechPost · כתבה · מתקדם
Alibaba Qwen משחרר Qwen3.8-Max: מודל MoE בן 2.4 טריליון פרמטרים
Qwen3.8-Max הוא מודל MoE בן 2.4 טריליון פרמטרים שמקבל טקסט, תמונה ווידאו ומחזיר טקסט. המודל זמין להורדה ולשימוש.
06YT AI Engineer · וידאו · מתקדם
איכות הנתונים היא כפולת החישוב
איכות הנתונים היא המפתח לביצועים טובים יותר של מודלים. ארי מורקוס, מ-DatologyAI, טוען כי איכות הנתונים היא 'כפולת החישוב' והחלק הפחות מהושקע באימון מודלים. הוא מציע מודל 'בית זיקוק' לנתונים, שכולל ניקוי, סידור, יצירה והרכבה, עם מיון איכותי, הסרת כפילויות ויצירה סינתטית.
07YT AI Engineer · וידאו · מתקדם
סוכנים בקנה מידה: מאחורי הדגם והתשתית של MiniMax
אוליב סונג, ראש קבוצת הלמידה חיזוקית ב-MiniMax, מדברת על התשתית מאחורי דגמי המשקל הפתוח של החברה. היא משתפת את הקהל בנושאי הנדסה, כולל כתיבת ליבת GPU ואופטימיזציה ברמת התוכנה.
08MIT Tech Review AI · כתבה · מתקדם
הדרך לעל-אינטליגנציה מלאכותית
מערכת בריאות המורכבת מסוכנים רבים, כל אחד מומחה בתחומו. הם יכולים להחליף נתונים, אך עדיין לא מסוגלים לתאם טיפול רפואי ללא החלטות אנושיות. תוספת שכבה סמנטית, 'אינטרנט של קוגניציה', מאפשרת לסוכנים לעבוד ול'חשוב' יחד.
13

מודלים רב-מודאליים open-source

Llama Vision, Qwen-VL, PaliGemma — איך מודלי שפה רואים תמונות, וידאו, אודיו.

~4 שעותמתקדם
שיעור

בעולם ה-AI המודרני, מודלים של שפה כבר אינם מוגבלים לטקסט בלבד. מודלים רב-מודאליים (Multimodal Models) בקוד פתוח, כדוגמת Llama 3.2 Vision, Qwen-VL ו-PaliGemma, חוללו מהפכה בכך שהם מאפשרים ל-LLM "לראות" תמונות ווידאו, ואף להבין אודיו באותה רשת נוירונים. פריצת הדרך הזו מתאפשרת על ידי חיבור של Vision Encoder (כמו CLIP או SigLIP) ישירות אל ה-Backbone של מודל השפה באמצעות שכבת קישור (Projection Layer) המתרגמת את הפיצ'רים הוויזואליים לטוקנים שהמודל מסוגל לעבד.

המעבר למודלים רב-מודאליים בקוד פתוח (Open-Source) הוא קריטי עבור ארגונים ומפתחים המעוניינים בפרטיות מידע מלאה, התאמה אישית (Fine-tuning) על דאטה ייחודי, ומניעת עלויות API גבוהות של מודלים סגורים. שימוש במודלים אלו נפוץ במיוחד במערכות RAG מתקדמות המשלבות מסמכים סרוקים, ניתוח אוטומטי של תרשימים רפואיים, פענוח קבלות (OCR מתקדם), ואפילו ניתוח בזמן אמת של מצלמות אבטחה ווידאו.

כדי לבנות יישומים מורכבים המשלבים ראייה ממוחשבת ושפה, אנו נעזרים בפריימוורקים מובילים לניהול קונטקסט. עדכונים אחרונים כמו LlamaIndex v0.14.15 וכן llama-index-core 0.14.16 מציגים שיפורים משמעותיים בתמיכה במודלי Vision, המאפשרים שליפת מידע מדויקת מתוך תמונות ומסמכים מרובי עמודים (Multi-modal RAG).

להלן דוגמה קונקרטית לטעינה והרצה של מודל Qwen-VL לניתוח תמונה באמצעות ספריית transformers של Hugging Face:

from transformers import Qwen2VLForConditionalGeneration, AutoProcessor
from PIL import Image

# טעינת המודל והמעבד המתאים
model = Qwen2VLForConditionalGeneration.from_pretrained("Qwen/Qwen2-VL-7B-Instruct", torch_dtype="auto", device_map="auto")
processor = AutoProcessor.from_pretrained("Qwen/Qwen2-VL-7B-Instruct")

image = Image.open("invoice.jpg")
messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "Extract the total amount and tax from this invoice."}]}]
text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = processor(text=[text], images=[image], padding=True, return_tensors="pt").to("cuda")

generated_ids = model.generate(**inputs, max_new_tokens=128)
print(processor.batch_decode(generated_ids, skip_special_tokens=True))

מעבר לניתוח טכני יבש, השילוב של יכולות ראייה פותח אפיקים חדשים של יצירתיות ופיתוח ממשקים אינטראקטיביים. כפי שמתואר במאמר על הגברת יצירתיות בעידן ה-AI מבית MIT Tech Review, השילוב של קלט ויזואלי מאפשר ליוצרים ומפתחים לעבוד בצורה אינטואיטיבית יותר, שבה המודל מבין סקיצות ידניות, עיצובי ממשק משתמש (UI) או תרשימי זרימה והופך אותם לקוד פרודקשן או ליצירות אמנות חדשות.

הצעד הבא שלכם: פרויקט הסטארטר המומלץ ביותר להתחלה הוא שימוש ב- LLaVA או ב- Qwen-VL. הורידו את אחד המודלים הללו באופן מקומי (למשל באמצעות Ollama או Hugging Face), והקימו יישום קטן שמקבל קובץ PDF סרוק ומפיק ממנו קובץ JSON מובנה המכיל את כל הנתונים החשובים מתוך הטבלאות והגרפים שבו.

פרויקטי התחלה2 REPOS
LLaVA
★ 21k
python מתקדם
מודל ה-vision-language open-source הראשון שהיה תחרותי מול GPT-4V. ארכיטקטורה ברורה, קל לאימון.
git clone https://github.com/haotian-liu/LLaVA && pip install -e .
GitHub ↗
Qwen-VL
★ 5.5k
python מתקדם
משפחת המודלים הוויזואליים של Alibaba — מובילה ב-benchmarks. תומכת תמונות, וידאו, OCR.
pip install transformers accelerate
GitHub ↗
חומרי קריאה8 פריטים
01MarkTechPost · כתבה · מתקדם
H Company משחררת NeoMME: משפחה של 260M ו-800M Single-Tower Multimodal Encoders
H Company השיקה NeoMME, משפחה של 260M ו-800M Single-Tower Multimodal Encoders שמשימתם לקצץ בפרמטרים ובחישוב.
02YT AI Engineer · וידאו · מתקדם
פאנל: תצורה על-שורה של מדיה יוצרת
צוות Google DeepMind דנה בפאנל על-שורה של תצורה יוצרת. הם דנו בקשר בין תצורה יוצרת לבין חידושים בתחום האינטרפטציה של האדם. הם גם דנו בקשר בין תצורה יוצרת לבין חידושים בתחום האינטרפטציה של האדם.
03YT AI Engineer · וידאו · מתקדם
הבאת סוכנים לרשת האינטרנט
פול קליין הרביעי מדבר על הבאת סוכנים לרשת האינטרנט. הוא טוען שהיכולת כבר קיימת, אך ההנדסה סביבה חסרה. סוכנים רב-מודאליים יכולים לכתוב קוד לצד לחיצות עכבר, ולהשתמש בתשתית שמנדרינה דפים באופן זהה.
04YT AI Engineer · וידאו · מתקדם
מצב הנתיביות של המודלים — NVIDIA, Cognition, OpenRouter
NVIDIA, Cognition ו-OpenRouter דנים בנתיביות מודלים. הם משווים ביצועים ועלות של מודלים שונים, ומציעים פתרונות לשיפור היעילות. הדיון כולל השוואה בין Opus ו-Haiku, והצגת גישות חדשות לניהול מודלים.
05MarkTechPost · כתבה · מתקדם
Alibaba Qwen משחרר Qwen3.8-Max: מודל MoE בן 2.4 טריליון פרמטרים
Qwen3.8-Max הוא מודל MoE בן 2.4 טריליון פרמטרים שמקבל טקסט, תמונה ווידאו ומחזיר טקסט. המודל זמין להורדה ולשימוש.
06YT AI Engineer · וידאו · מתקדם
איכות הנתונים היא כפולת החישוב
איכות הנתונים היא המפתח לביצועים טובים יותר של מודלים. ארי מורקוס, מ-DatologyAI, טוען כי איכות הנתונים היא 'כפולת החישוב' והחלק הפחות מהושקע באימון מודלים. הוא מציע מודל 'בית זיקוק' לנתונים, שכולל ניקוי, סידור, יצירה והרכבה, עם מיון איכותי, הסרת כפילויות ויצירה סינתטית.
07YT AI Engineer · וידאו · מתקדם
סוכנים בקנה מידה: מאחורי הדגם והתשתית של MiniMax
אוליב סונג, ראש קבוצת הלמידה חיזוקית ב-MiniMax, מדברת על התשתית מאחורי דגמי המשקל הפתוח של החברה. היא משתפת את הקהל בנושאי הנדסה, כולל כתיבת ליבת GPU ואופטימיזציה ברמת התוכנה.
08MIT Tech Review AI · כתבה · מתקדם
הדרך לעל-אינטליגנציה מלאכותית
מערכת בריאות המורכבת מסוכנים רבים, כל אחד מומחה בתחומו. הם יכולים להחליף נתונים, אך עדיין לא מסוגלים לתאם טיפול רפואי ללא החלטות אנושיות. תוספת שכבה סמנטית, 'אינטרנט של קוגניציה', מאפשרת לסוכנים לעבוד ול'חשוב' יחד.
14

Quantization: GGUF, AWQ, GPTQ

איך מריצים מודל 70B על לאפטופ. השוואת שיטות quantization וההשפעה על איכות.

~3 שעותמתקדם
שיעור

להריץ מודל שפה ענק של 70 מיליארד פרמטרים (70B) על מחשב נייד אישי נשמע בעבר כמו מדע בדיוני. מודל כזה בפורמט FP16 (דיוק של 16-bit) דורש מעל 140GB של זיכרון VRAM/RAM רק כדי להיטען. כאן נכנסת לתמונה טכנולוגיית ה-Quantization (כימות), המאפשרת לדחוס את משקולות המודל ל-4-bit או 8-bit, ובכך להפחית את דרישות הזיכרון בכ-75% תוך שמירה על ביצועים קרובים מאוד למקור. פריצת הדרך הזו מאפשרת להריץ מודלים מקומיים חזקים ישירות על חומרת קצה, כפי שמתואר בדיון על יצירת עוזר AI פרטי ב-Thunderbird.

הפורמט הפופולרי ביותר להרצה מקומית על מעבדים (CPU) ומעבדי Apple Silicon הוא GGUF, שפותח כחלק מפרויקט llama.cpp. GGUF מותאם במיוחד להרצה יעילה תוך שיתוף זיכרון בין ה-CPU ל-GPU (במיוחד ב-MacBook עם Unified Memory). הוא תומך בטכניקות כימות מתקדמות (כמו k-quants) המאפשרות להריץ מודל 70B בכימות של 4-bit (הדורש כ-40GB RAM בלבד) במהירות סבירה לחלוטין לשימוש יומיומי.

עבור שרתי GPU ומשימות הדורשות מהירות הפקה (throughput) גבוהה, אנו משתמשים בפורמטים כמו GPTQ ו-AWQ. בעוד ש-GPTQ מבצע כימות סטטי המבוסס על כיול חד-פעמי, שיטת AWQ (Activation-aware Weight Quantization), הנתמכת על ידי ספריות כמו AutoAWQ, מגינה על משקולות קריטיות ("salient weights") שמושפעות ביותר בזמן ה-activation. גישה זו שומרת על דיוק גבוה משמעותית בכימות של 4-bit, ומאפשרת אינטגרציה חלקה עם מנועי הרצה מהירים כמו vLLM ו-Hugging Face.

הבחירה בין השיטות תלויה בחומרה ובשימוש: GGUF הוא המלך הבלתי מעורער של הרצה מקומית על מחשבים ניידים ומעבדים משולבים. AWQ ו-GPTQ מיועדים ל-GPUs ייעודיים (כמו כרטיסי Nvidia RTX) ומספקים מהירות הפקה גבוהה בהרבה בסביבות פרודקשן. הירידה באיכות (Perplexity) במעבר ל-4-bit היא מינורית ביותר ברוב המשימות, מה שהופך את הוויתור על הדיוק המלא למשתלם במיוחד במאבק בין האגדה על מלחמות המודלים: פתוח vs סגור ב-2026.

להלן דוגמה פשוטה להרצת מודל Llama 3 8B בפורמט GGUF מקומית באמצעות Python וספריית llama-cpp-python:

from llama_cpp import Llama

# טעינת מודל GGUF שעבר כימות ל-4-bit
llm = Llama(
    model_path="./llama-3-8b-Instruct-Q4_K_M.gguf",
    n_ctx=2048,  # אורך ההקשר
    n_threads=8  # מספר ליבות ה-CPU לשימוש
)

# הרצת פרומפט
output = llm("Q: What is the benefit of AWQ over GPTQ? A:", max_tokens=100)
print(output["choices"][0]["text"])

הצעד הבא שלכם: הורידו את כלי ה-CLI של llama.cpp, הורידו מודל Llama 3 8B בפורמט GGUF (למשל גרסת Q4_K_M מ-Hugging Face), והריצו אותו מקומית דרך הטרמינל שלכם. זו הדרך המהירה ביותר להבין את העוצמה של מודלים מכומתים על המחשב האישי שלכם.

פרויקטי התחלה2 REPOS
llama.cpp + GGUF
★ 70k
cpp מתקדם
הפורמט הסטנדרטי לקבצי quantized. 4-bit לרוב, 8-bit ליעדים גבוהים. הריצו 70B על MacBook.
huggingface-cli download bartowski/Meta-Llama-3.3-70B-Instruct-GGUF Q4_K_M.gguf
GitHub ↗
AutoAWQ
★ 2.2k
python מתקדם
Activation-aware Weight Quantization — איכות גבוהה ב-4-bit. אינטגרציה עם vLLM/HF.
pip install autoawq
GitHub ↗
חומרי קריאה8 פריטים
01Vercel AI SDK · כתבה · מתקדם
פיצ' זי: @ai-sdk/zai@3.0.10
נערכו תלותיות ב@ai-sdk/zai@3.0.10
02Vercel AI SDK · כתבה · מתקדם
XAI 4.0.58: תיקון תמיכה לבקשות קבוצה לא תואמות
XAI 4.0.58: תיקון לבקשות קבוצה לא תואמות. התוסף תומך כעת בבקשות ייצור תמונות בקבוצות.
03Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/tui@1.0.99
עודכן תלותיות ב @ai-sdk/tui לגרסה 1.0.99. העדכון כולל עדכון של תלותיות באי-סדק.
04LangChain releases · כתבה · מתקדם
langchain-openai==1.6.2
langchain-openai==1.6.2: הוספת ניסיונות תגובה של GPT-6 Astra
05YT Nate Herk · וידאו · כללי
תודה ל-1,000,000 מנויים
יוצר יוצא ל-1,000,000 מנויים, 2 שנים לאחר שפרסם את הסרטון הראשון שלו. הוא תודה לקהל שלו ולכל האנשים שעזרו לו להגיע למאזן הזה.
06Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/zai@3.0.7
עודכן תלותיות @ai-sdk/zai@3.0.7, כולל @ai-sdk/provider@4.0.11, @ai-sdk/provider-utils@5.0.37 ו@ai-sdk/openai-compatible@3.0.45
07Vercel AI SDK · כתבה · מתקדם
XAI 4.0.55: תמיכה במודלים לפי בקשה ב batch
XAI 4.0.55 תומכת במודלים לפי בקשה ב batch. נעשו גם עדכוני תלות.
08Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/workflow@2.0.25
עודכן תלותיות ב @ai-sdk/workflow@2.0.25. עודכן ai@7.0.94, @ai-sdk/provider@4.0.11 ו-@ai-sdk/provider-utils@5.0.37.
15

Quantization: GGUF, AWQ, GPTQ

איך מריצים מודל 70B על לאפטופ. השוואת שיטות quantization וההשפעה על איכות.

~3 שעותמתקדם
שיעור

להריץ מודל שפה ענק של 70 מיליארד פרמטרים (70B) על מחשב נייד אישי נשמע בעבר כמו מדע בדיוני. מודל כזה בפורמט FP16 (דיוק של 16-bit) דורש מעל 140GB של זיכרון VRAM/RAM רק כדי להיטען. כאן נכנסת לתמונה טכנולוגיית ה-Quantization (כימות), המאפשרת לדחוס את משקולות המודל ל-4-bit או 8-bit, ובכך להפחית את דרישות הזיכרון בכ-75% תוך שמירה על ביצועים קרובים מאוד למקור. פריצת הדרך הזו מאפשרת להריץ מודלים מקומיים חזקים ישירות על חומרת קצה, כפי שמתואר בדיון על יצירת עוזר AI פרטי ב-Thunderbird.

הפורמט הפופולרי ביותר להרצה מקומית על מעבדים (CPU) ומעבדי Apple Silicon הוא GGUF, שפותח כחלק מפרויקט llama.cpp. GGUF מותאם במיוחד להרצה יעילה תוך שיתוף זיכרון בין ה-CPU ל-GPU (במיוחד ב-MacBook עם Unified Memory). הוא תומך בטכניקות כימות מתקדמות (כמו k-quants) המאפשרות להריץ מודל 70B בכימות של 4-bit (הדורש כ-40GB RAM בלבד) במהירות סבירה לחלוטין לשימוש יומיומי.

עבור שרתי GPU ומשימות הדורשות מהירות הפקה (throughput) גבוהה, אנו משתמשים בפורמטים כמו GPTQ ו-AWQ. בעוד ש-GPTQ מבצע כימות סטטי המבוסס על כיול חד-פעמי, שיטת AWQ (Activation-aware Weight Quantization), הנתמכת על ידי ספריות כמו AutoAWQ, מגינה על משקולות קריטיות ("salient weights") שמושפעות ביותר בזמן ה-activation. גישה זו שומרת על דיוק גבוה משמעותית בכימות של 4-bit, ומאפשרת אינטגרציה חלקה עם מנועי הרצה מהירים כמו vLLM ו-Hugging Face.

הבחירה בין השיטות תלויה בחומרה ובשימוש: GGUF הוא המלך הבלתי מעורער של הרצה מקומית על מחשבים ניידים ומעבדים משולבים. AWQ ו-GPTQ מיועדים ל-GPUs ייעודיים (כמו כרטיסי Nvidia RTX) ומספקים מהירות הפקה גבוהה בהרבה בסביבות פרודקשן. הירידה באיכות (Perplexity) במעבר ל-4-bit היא מינורית ביותר ברוב המשימות, מה שהופך את הוויתור על הדיוק המלא למשתלם במיוחד במאבק בין האגדה על מלחמות המודלים: פתוח vs סגור ב-2026.

להלן דוגמה פשוטה להרצת מודל Llama 3 8B בפורמט GGUF מקומית באמצעות Python וספריית llama-cpp-python:

from llama_cpp import Llama

# טעינת מודל GGUF שעבר כימות ל-4-bit
llm = Llama(
    model_path="./llama-3-8b-Instruct-Q4_K_M.gguf",
    n_ctx=2048,  # אורך ההקשר
    n_threads=8  # מספר ליבות ה-CPU לשימוש
)

# הרצת פרומפט
output = llm("Q: What is the benefit of AWQ over GPTQ? A:", max_tokens=100)
print(output["choices"][0]["text"])

הצעד הבא שלכם: הורידו את כלי ה-CLI של llama.cpp, הורידו מודל Llama 3 8B בפורמט GGUF (למשל גרסת Q4_K_M מ-Hugging Face), והריצו אותו מקומית דרך הטרמינל שלכם. זו הדרך המהירה ביותר להבין את העוצמה של מודלים מכומתים על המחשב האישי שלכם.

פרויקטי התחלה2 REPOS
llama.cpp + GGUF
★ 70k
cpp מתקדם
הפורמט הסטנדרטי לקבצי quantized. 4-bit לרוב, 8-bit ליעדים גבוהים. הריצו 70B על MacBook.
huggingface-cli download bartowski/Meta-Llama-3.3-70B-Instruct-GGUF Q4_K_M.gguf
GitHub ↗
AutoAWQ
★ 2.2k
python מתקדם
Activation-aware Weight Quantization — איכות גבוהה ב-4-bit. אינטגרציה עם vLLM/HF.
pip install autoawq
GitHub ↗
חומרי קריאה8 פריטים
01Vercel AI SDK · כתבה · מתקדם
פיצ' זי: @ai-sdk/zai@3.0.10
נערכו תלותיות ב@ai-sdk/zai@3.0.10
02Vercel AI SDK · כתבה · מתקדם
XAI 4.0.58: תיקון תמיכה לבקשות קבוצה לא תואמות
XAI 4.0.58: תיקון לבקשות קבוצה לא תואמות. התוסף תומך כעת בבקשות ייצור תמונות בקבוצות.
03Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/tui@1.0.99
עודכן תלותיות ב @ai-sdk/tui לגרסה 1.0.99. העדכון כולל עדכון של תלותיות באי-סדק.
04LangChain releases · כתבה · מתקדם
langchain-openai==1.6.2
langchain-openai==1.6.2: הוספת ניסיונות תגובה של GPT-6 Astra
05YT Nate Herk · וידאו · כללי
תודה ל-1,000,000 מנויים
יוצר יוצא ל-1,000,000 מנויים, 2 שנים לאחר שפרסם את הסרטון הראשון שלו. הוא תודה לקהל שלו ולכל האנשים שעזרו לו להגיע למאזן הזה.
06Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/zai@3.0.7
עודכן תלותיות @ai-sdk/zai@3.0.7, כולל @ai-sdk/provider@4.0.11, @ai-sdk/provider-utils@5.0.37 ו@ai-sdk/openai-compatible@3.0.45
07Vercel AI SDK · כתבה · מתקדם
XAI 4.0.55: תמיכה במודלים לפי בקשה ב batch
XAI 4.0.55 תומכת במודלים לפי בקשה ב batch. נעשו גם עדכוני תלות.
08Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/workflow@2.0.25
עודכן תלותיות ב @ai-sdk/workflow@2.0.25. עודכן ai@7.0.94, @ai-sdk/provider@4.0.11 ו-@ai-sdk/provider-utils@5.0.37.
16

RAG מקומי לחלוטין — Ollama + Chroma

מערכת RAG שלמה רצה על המחשב שלך, ללא APIs חיצוניים. embedding מקומי + DB מקומי.

~4 שעותבינוני
שיעור

מערכת RAG (Retrieval-Augmented Generation) מקומית לחלוטין מאפשרת לנו לבנות יישומי בינה מלאכותית חכמים המבוססים על המידע הפרטי שלנו, מבלי לשלוח אף פיסת מידע לענן. השילוב בין Ollama (להרצת מודלי שפה ומודלי Embeddings מקומיים) לבין Chroma (מסד נתונים וקטורי קל ומהיר) מייצר סביבת עבודה עצמאית לחלוטין, הפועלת ישירות על המחשב האישי שלכם.

הסיבות המרכזיות למעבר ל-RAG מקומי הן פרטיות מידע מוחלטת, אבטחה, וחיסכון בעלויות API. בארגונים רבים, מידע רגיש אינו יכול לצאת מגבולות הרשת המקומית. בנוסף, פיתוח מקומי מאפשר בדיקה מהירה של ארכיטקטורות RAG שונות ללא חשש מעלויות מצטברות. עם זאת, עבודה מקומית דורשת הבנה של מגבלות המודלים. מחקרים כמו השטח המת של הייחוס מראים כי מודלים מקומיים לעיתים מתקשים להבחין בין ידע מאוחזר לבין הזיכרון הפנימי שלהם, בעוד שמחקרים אחרים כגון לזהות זה לא לפתור: פער הניטור והבקרה במערכות RAG מדגישים את החשיבות של בקרה וניטור קפדניים על איכות האחזור גם בסביבה מקומית.

כדי להקים מערכת כזו, אנו משתמשים ב-Ollama כדי להריץ מודל שפה (כמו Llama 3) ומודל ייצוג וקטורי (Embedding). הטקסטים שלנו עוברים תהליך של "צ'אנקניג" (פירוק למקטעים), מומרים לווקטורים באמצעות מודל ה-Embedding, ונשמרים בתוך Chroma DB. כאשר המשתמש שואל שאלה, השאלה מומרת לווקטור, Chroma שולף את המקטעים הרלוונטיים ביותר, ואלו נשלחים יחד עם השאלה כהקשר (Context) למודל השפה המקומי ב-Ollama שמייצר את התשובה הסופית.

הנה דוגמה פשוטה המציגה כיצד ניתן לחבר את הרכיבים הללו באמצעות Python וספריית Chroma:

import chromadb
from chromadb.utils import embedding_functions

# חיבור ל-Chroma מקומי והגדרת מודל Embedding של Ollama
client = chromadb.PersistentClient(path="./chroma_db")
ollama_ef = embedding_functions.OllamaEmbeddingFunction(
    url="http://localhost:11434/api/embeddings",
    model_name="nomic-embed-text"
)
collection = client.get_or_create_collection(name="local_docs", embedding_function=ollama_ef)

# הוספת מסמכים ואחזור
collection.add(documents=["Ollama runs LLMs locally", "Chroma is a vector database"], ids=["id1", "id2"])
results = collection.query(query_texts=["What is Chroma?"], n_results=1)
print(results["documents"])

הצעד הבא שלכם הוא להתקין את Ollama על המחשב, להוריד מודל כמו llama3 ומודל embedding כמו nomic-embed-text. לאחר מכן, מומלץ להוריד ולהריץ את פרויקט הקוד Ollama + Chroma כדי לראות את המערכת בפעולה, או להשתמש ב-LlamaIndex כדי לבנות צינורות RAG מתקדמים ומורכבים יותר בקלות.

פרויקטי התחלה3 REPOS
Cloudflare RAG Starter
★ 800
typescript בינוני
תבנית RAG מלאה — Workers + Vectorize + Workers AI. רצה חינם, deploy בקליק.
npm create cloudflare@latest -- --template=cloudflare/templates/rag-ai-tutorial
GitHub ↗
Ollama + Chroma
★ 17k
python בינוני
Chroma DB מקומי + Ollama. embedding מקומי, retrieval מקומי, generation מקומי — אפס APIs חיצוניים.
pip install chromadb && curl -fsSL https://ollama.com/install.sh | sh
GitHub ↗
LlamaIndex
★ 38k
python בינוני
הספרייה המקיפה ל-RAG. תומכת Ollama/HuggingFace embedders, Chroma/Qdrant/Pinecone retrievers.
pip install llama-index llama-index-llms-ollama llama-index-embeddings-huggingface
GitHub ↗
חומרי קריאה8 פריטים
01LangChain releases · כתבה · מתקדם
langchain-openai==1.6.2
langchain-openai==1.6.2: הוספת ניסיונות תגובה של GPT-6 Astra
02Pydantic AI · כתבה · מתקדם
v2.32.0 (2026-08-18)
שיפורים בתפקוד החיפוש וההפניות ב-v2.32.0
03YT AI Engineer · וידאו · מתקדם
CrabRAG: מדוע עוזרים אוטומטיים זקוקים לזיכרון גרפי, לא ליותר טוקנים
סטיבן צ'ין הדגים את CrabRAG, טכנולוגיה המשתמשת בזיכרון גרפי כדי לשפר את ביצועיהם של עוזרים אוטומטיים. הוא הראה כיצד זיכרון גרפי מתגבר על מגבלות זיכרון וקטורי. Claude, העוזר האוטומטי, יכול לכתוב Cypher, שפת גרפים, טוב יותר מאשר אדם.
04Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
05YT AI Engineer · וידאו · מתקדם
דילוג על מס לרב-מודאלי: RAG היברידי, SQL RRF וטלמטריה UI
אבד מתיני מציג פרוטוטיפ לממשק צ'אטבוט המשלב RAG היברידי, SQL RRF וטלמטריה UI. הדגמה תציג איך לחסוך בעלויות API ולשפר ביצועים.
06YT AI Engineer · וידאו · מתקדם
תורבוצ'רג' את זיכרון האג'נט עם TurboQuant
TurboQuant הוא שיטה לדחיסת וקטורים ל-3–4 ביטים, תוך שמירה על איכות. הוא פותח על ידי Google Research ויכול לשמש לשיפור זיכרון האג'נט.
07YT AI Engineer · וידאו · בינוני
מבנה ללא-מבנה - סדריק קליבורן, Red Hat
ארגונים מודרניים מייצרים כמויות גדולות של נתונים בפורמטים שונים ולעיתים לא מובנים. האתגר הוא לשמר את המבנה, ההקשר והיחסים בתוך הנתונים. סדריק קליבורן מ-Red Hat מדבר על טכניקות וכלים פתוחים להפיכת מסמכים לא-מובנים לפורמטים מובנים.
08CrewAI releases · כתבה · מתקדם
עדכון 1.14.7a4
עדכון 1.14.7a4 של LangChain כולל מעבר ל-FlowDefinition ותמיכה בבקרים חדשים. העדכון גם כולל עדכונים למסמכים.
17

RAG מקומי לחלוטין — Ollama + Chroma

מערכת RAG שלמה רצה על המחשב שלך, ללא APIs חיצוניים. embedding מקומי + DB מקומי.

~4 שעותבינוני
שיעור

מערכת RAG (Retrieval-Augmented Generation) מקומית לחלוטין מאפשרת לנו לבנות יישומי בינה מלאכותית חכמים המבוססים על המידע הפרטי שלנו, מבלי לשלוח אף פיסת מידע לענן. השילוב בין Ollama (להרצת מודלי שפה ומודלי Embeddings מקומיים) לבין Chroma (מסד נתונים וקטורי קל ומהיר) מייצר סביבת עבודה עצמאית לחלוטין, הפועלת ישירות על המחשב האישי שלכם.

הסיבות המרכזיות למעבר ל-RAG מקומי הן פרטיות מידע מוחלטת, אבטחה, וחיסכון בעלויות API. בארגונים רבים, מידע רגיש אינו יכול לצאת מגבולות הרשת המקומית. בנוסף, פיתוח מקומי מאפשר בדיקה מהירה של ארכיטקטורות RAG שונות ללא חשש מעלויות מצטברות. עם זאת, עבודה מקומית דורשת הבנה של מגבלות המודלים. מחקרים כמו השטח המת של הייחוס מראים כי מודלים מקומיים לעיתים מתקשים להבחין בין ידע מאוחזר לבין הזיכרון הפנימי שלהם, בעוד שמחקרים אחרים כגון לזהות זה לא לפתור: פער הניטור והבקרה במערכות RAG מדגישים את החשיבות של בקרה וניטור קפדניים על איכות האחזור גם בסביבה מקומית.

כדי להקים מערכת כזו, אנו משתמשים ב-Ollama כדי להריץ מודל שפה (כמו Llama 3) ומודל ייצוג וקטורי (Embedding). הטקסטים שלנו עוברים תהליך של "צ'אנקניג" (פירוק למקטעים), מומרים לווקטורים באמצעות מודל ה-Embedding, ונשמרים בתוך Chroma DB. כאשר המשתמש שואל שאלה, השאלה מומרת לווקטור, Chroma שולף את המקטעים הרלוונטיים ביותר, ואלו נשלחים יחד עם השאלה כהקשר (Context) למודל השפה המקומי ב-Ollama שמייצר את התשובה הסופית.

הנה דוגמה פשוטה המציגה כיצד ניתן לחבר את הרכיבים הללו באמצעות Python וספריית Chroma:

import chromadb
from chromadb.utils import embedding_functions

# חיבור ל-Chroma מקומי והגדרת מודל Embedding של Ollama
client = chromadb.PersistentClient(path="./chroma_db")
ollama_ef = embedding_functions.OllamaEmbeddingFunction(
    url="http://localhost:11434/api/embeddings",
    model_name="nomic-embed-text"
)
collection = client.get_or_create_collection(name="local_docs", embedding_function=ollama_ef)

# הוספת מסמכים ואחזור
collection.add(documents=["Ollama runs LLMs locally", "Chroma is a vector database"], ids=["id1", "id2"])
results = collection.query(query_texts=["What is Chroma?"], n_results=1)
print(results["documents"])

הצעד הבא שלכם הוא להתקין את Ollama על המחשב, להוריד מודל כמו llama3 ומודל embedding כמו nomic-embed-text. לאחר מכן, מומלץ להוריד ולהריץ את פרויקט הקוד Ollama + Chroma כדי לראות את המערכת בפעולה, או להשתמש ב-LlamaIndex כדי לבנות צינורות RAG מתקדמים ומורכבים יותר בקלות.

פרויקטי התחלה3 REPOS
Cloudflare RAG Starter
★ 800
typescript בינוני
תבנית RAG מלאה — Workers + Vectorize + Workers AI. רצה חינם, deploy בקליק.
npm create cloudflare@latest -- --template=cloudflare/templates/rag-ai-tutorial
GitHub ↗
Ollama + Chroma
★ 17k
python בינוני
Chroma DB מקומי + Ollama. embedding מקומי, retrieval מקומי, generation מקומי — אפס APIs חיצוניים.
pip install chromadb && curl -fsSL https://ollama.com/install.sh | sh
GitHub ↗
LlamaIndex
★ 38k
python בינוני
הספרייה המקיפה ל-RAG. תומכת Ollama/HuggingFace embedders, Chroma/Qdrant/Pinecone retrievers.
pip install llama-index llama-index-llms-ollama llama-index-embeddings-huggingface
GitHub ↗
חומרי קריאה8 פריטים
01LangChain releases · כתבה · מתקדם
langchain-openai==1.6.2
langchain-openai==1.6.2: הוספת ניסיונות תגובה של GPT-6 Astra
02Pydantic AI · כתבה · מתקדם
v2.32.0 (2026-08-18)
שיפורים בתפקוד החיפוש וההפניות ב-v2.32.0
03YT AI Engineer · וידאו · מתקדם
CrabRAG: מדוע עוזרים אוטומטיים זקוקים לזיכרון גרפי, לא ליותר טוקנים
סטיבן צ'ין הדגים את CrabRAG, טכנולוגיה המשתמשת בזיכרון גרפי כדי לשפר את ביצועיהם של עוזרים אוטומטיים. הוא הראה כיצד זיכרון גרפי מתגבר על מגבלות זיכרון וקטורי. Claude, העוזר האוטומטי, יכול לכתוב Cypher, שפת גרפים, טוב יותר מאשר אדם.
04Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
05YT AI Engineer · וידאו · מתקדם
דילוג על מס לרב-מודאלי: RAG היברידי, SQL RRF וטלמטריה UI
אבד מתיני מציג פרוטוטיפ לממשק צ'אטבוט המשלב RAG היברידי, SQL RRF וטלמטריה UI. הדגמה תציג איך לחסוך בעלויות API ולשפר ביצועים.
06YT AI Engineer · וידאו · מתקדם
תורבוצ'רג' את זיכרון האג'נט עם TurboQuant
TurboQuant הוא שיטה לדחיסת וקטורים ל-3–4 ביטים, תוך שמירה על איכות. הוא פותח על ידי Google Research ויכול לשמש לשיפור זיכרון האג'נט.
07YT AI Engineer · וידאו · בינוני
מבנה ללא-מבנה - סדריק קליבורן, Red Hat
ארגונים מודרניים מייצרים כמויות גדולות של נתונים בפורמטים שונים ולעיתים לא מובנים. האתגר הוא לשמר את המבנה, ההקשר והיחסים בתוך הנתונים. סדריק קליבורן מ-Red Hat מדבר על טכניקות וכלים פתוחים להפיכת מסמכים לא-מובנים לפורמטים מובנים.
08CrewAI releases · כתבה · מתקדם
עדכון 1.14.7a4
עדכון 1.14.7a4 של LangChain כולל מעבר ל-FlowDefinition ותמיכה בבקרים חדשים. העדכון גם כולל עדכונים למסמכים.