יום שלישי, 15 בספטמבר 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים AI Researcher
מסלול לימוד

AI Researcher

מאמרים, post-training, alignment, evals בקצה.

30 שעות
4 צמתים
מתקדם
01

איך לקרוא מאמרי AI

arXiv, Papers With Code, פיענוח abstract בלי לטבוע.

~3 שעותמתקדם
שיעור

בעולם ה-AI המתפתח בקצב מסחרר, היכולת לקרוא ולהבין מאמרים אקדמיים ישירות מ-arXiv היא לא רק פריבילגיה של חוקרים, אלא כלי הישרדות הכרחי למפתחים מתקדמים. רוב פריצות הדרך המשמעותיות מגיעות לציבור כמאמרים חודשים רבים לפני שהן מתורגמות לספריות קוד פופולריות או למוצרים מסחריים. הבנת המבנה של מאמר מדעי מאפשרת לכם להישאר בחזית הטכנולוגיה, להבין את התיאוריה שמאחורי האלגוריתמים וליישם פתרונות מתקדמים לפני כולם.

קריאת מאמר מדעי אינה דומה לקריאת ספר או פוסט בבלוג. כדי לא לטבוע בים של מתמטיקה ונוסחאות, מומלץ לאמץ את שיטת "שלושת המעברים". במעבר הראשון, מתמקדים ב-Abstract (תקציר), ב-Introduction (מבוא) ובאיורים (Figures). מטרת שלב זה היא להבין את הבעיה שהמאמר מנסה לפתור ואת התרומה העיקרית שלו. רק אם המאמר נמצא רלוונטי עבורכם, ממשיכים למעבר השני שבוחן את הארכיטקטורה והתוצאות (Results), ורק במעבר השלישי צוללים להוכחות המתמטיות ולפרטי המימוש הקטנים.

אחד הכלים החזקים ביותר העומדים לרשותנו כיום הוא Papers With Code. פלטפורמה זו מקשרת באופן אוטומטי בין מאמרי arXiv לבין מימושי קוד פתוח ב-GitHub. חיבור זה מאפשר לכם לראות מיד כיצד המשוואות המורכבות מהמאמר הופכות לשורות קוד ב-PyTorch או TensorFlow. במקום לנסות לפענח ארכיטקטורה מסובכת רק מתוך טקסט, תוכלו להריץ את הקוד הרשמי של החוקרים, לבצע דיבאג ולראות את זרימת הנתונים בזמן אמת.

כדי להפוך את תהליך החיפוש והמחקר לאוטומטי, ניתן להשתמש ב-API הרשמי של Papers With Code. הנה דוגמה קצרה המציגה כיצד לחפש מאמרים ולקבל את קישורי הקוד שלהם ישירות מתוך סקריפט Python:

from paperswithcode import PapersWithCodeClient

client = PapersWithCodeClient()
# חיפוש מאמרים בנושא סוכני AI
results = client.paper_list(q="Agentic AI", page=1, items_per_page=3)

for paper in results.results:
    print(f"Title: {paper.title}")
    print(f"arXiv: {paper.arxiv_id if paper.arxiv_id else 'N/A'}")
    print(f"URL: {paper.url}\n")

הבנת מאמרים היא קריטית במיוחד בתחומים מתפתחים כמו סוכנים אוטונומיים או יישומי AI ברפואה. לדוגמה, כדי להבין את האתגרים העמוקים של עיבוד תמונות רפואיות מורכבות, מומלץ להאזין לפרק ראייה מעבר לסריקה בנוירואימג'ינג — Practical AI, המדגים כיצד מחקר אקדמי מתורגם לפרקטיקה רפואית. כמו כן, אם אתם מתעניינים בסוכנים הלומדים ומתפתחים באופן דינמי, הפרק Hermes Agent: סוכנים AI שמתפתחים איתך — Practical AI יספק לכם הצצה מרתקת למאמרים ורעיונות שנמצאים כעת בחזית המחקר.

הצעד הבא שלכם: התקינו את חבילת הלקוח באמצעות הפקודה pip install paperswithcode-client. בחרו מאמר אחד שמעניין אתכם מתוך רשימת המאמרים האחרונים ב-arXiv, קראו את ה-Abstract שלו לפי שיטת המעבר הראשון, והשתמשו בקוד שכתבנו למעלה כדי למצוא את מימוש ה-GitHub הרשמי שלו. נסו להריץ את ה-Notebook של המאמר ב-Google Colab כדי לראות את התיאוריה קמה לתחייה.

פרויקטי התחלה1 REPOS
Papers With Code
★ 700
python בינוני
API לחיפוש מאמרים + קוד. מצוין לבנות קוראי-מאמרים חכמים.
pip install paperswithcode-client
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
סוכנים אמינים: ערימת סוכנים אחראית
גיסל ואן דונגן מציגה את Restate, פלטפורמה לבניית סוכנים אמינים. היא מדגימה סוכן מחקר עמוק החי ב-Slack, המשתמש ביומן אירועים לשיקום תהליכים כושלים. הפלטפורמה שואבת השראה מ-Apache Flink ותשתית אירועים של Meta.
02YT AI Engineer · וידאו · מתקדם
חור: סוכני תקיפה לבדיקת חוסר צדקות שלך — Brendan Rappazzo, Morgan Stanley
Loophole היא טכנולוגיה שמשתמשת בסוכני תקיפה כדי לבדוק את הצדקות שלך ולמצוא חורים בחוק. היא נוצרה על ידי Brendan Rappazzo, מחקרן ללמידת מכונה ב-Morgan Stanley. הפרויקט הושק כפרויקט פתוח, ואינו קשור לעבודתו של Rappazzo ב-Morgan Stanley.
03YT Nate Herk · וידאו · בינוני
איך לבחור את ה- AI Agent הנכון
בחירת ה- AI Agent הנכון לצורכיו שלך. נקודות עיקריות: חיבור ל- Claude, גמיני ו- LangGraph, ועוד.
04Claude Agent SDK (ts) · כתבה · מתקדם
Claude v0.3.269: תיקונים ושיפורים
Claude v0.3.269: תיקונים ושיפורים במערכת ה-Claude. תוקנו בעיות ושופרו כמה תכונות במערכת.
05Vercel AI SDK · כתבה · מתקדם
פיצ' זי: @ai-sdk/zai@3.0.10
נערכו תלותיות ב@ai-sdk/zai@3.0.10
06Vercel AI SDK · כתבה · מתקדם
XAI 4.0.58: תיקון תמיכה לבקשות קבוצה לא תואמות
XAI 4.0.58: תיקון לבקשות קבוצה לא תואמות. התוסף תומך כעת בבקשות ייצור תמונות בקבוצות.
07LangChain releases · כתבה · מתקדם
langchain-core==1.6.3
langchain-core==1.6.3: הוספת תכונת עקיבה של שם המודל וספקי המדענות
08LangChain releases · כתבה · מתקדם
langchain-openai==1.6.2
langchain-openai==1.6.2: הוספת ניסיונות תגובה של GPT-6 Astra
02

Post-training: RLHF / DPO

איך הופכים base model ל-assistant — שיטות עכשוויות.

~5 שעותמתקדם
שיעור

אימון מודל שפה ראשוני (Base Model) על כמויות עתק של טקסט מייצר "מנחש מילים" מצוין, אך לא עוזר אישי (Assistant) שיודע לעקוב אחר הוראות, להפגין נימוס או להימנע מתשובות מזיקות. כדי לגשר על הפער הזה, אנו משתמשים בשלב ה-Post-training. בעבר, השיטה השולטת הייתה RLHF (Reinforcement Learning from Human Feedback) המבוססת על אלגוריתם PPO, אך כיום תעשיית ה-AI נעה במהירות לעבר שיטות פשוטות ויציבות יותר כמו DPO (Direct Preference Optimization) וגרסאות מתקדמות כמו GRPO (המשמשת במודלים כמו DeepSeek-R1).

בעוד ש-RLHF קלאסי דורש אימון של מודל תגמול נפרד (Reward Model) והרצה של תהליך למידת חיזוק מורכב ורגיש להיפר-פרמטרים, DPO מפשט את התהליך באופן דרמטי. DPO מנסח מחדש את בעיית האופטימיזציה כך שניתן לאמן את מודל המטרה ישירות על זוגות של העדפות (תשובה מועדפת לעומת תשובה דחויה) באמצעות Loss פשוט של סיווג בינארי. גישה זו חוסכת משאבי חישוב רבים ומספקת יציבות מתמטית גבוהה בהרבה, מה שהופך אותה לסטנדרט דה-פקטו באימון מודלים פתוחים וסגורים כאחד.

הצורך בלמידה מבוססת העדפות אינו מוגבל רק לצ'אטבוטים כלליים. מחקרים עדכניים מראים כיצד עקרונות אלו מיושמים בתחומים קריטיים ומורכבים. לדוגמה, במאמר למידת יעדים מבוססי העדפות מתוך סיפורי מטופלים לטיפול דינמי בספסיס נעשה שימוש בלמידת העדפות כדי להתאים טיפול רפואי אישי ומציל חיים. הבנת הניואנסים של העדפות אנושיות היא קריטית גם כאשר דנים בעתיד של מודלים פתוחים מול סגורים, כפי שמתואר בפודקאסט האגדה על מלחמות המודלים: פתוח vs סגור ב-2026 — Practical AI, שם נידונה החשיבות של נגישות כלי פוסט-טריינינג לקהילת הקוד הפתוח.

כדי להתחיל ליישם DPO או RLHF בעצמכם, הספרייה המובילה כיום היא TRL (Transformer Reinforcement Learning) מבית HuggingFace. הספרייה מספקת ממשק קל ואינטואיטיבי (API) המשתלב בצורה מושלמת עם transformers ו-accelerate, ומאפשרת להריץ אימוני DPO, PPO ו-GRPO בכמה שורות קוד בודדות, תוך תמיכה בטכניקות יעילות כמו LoRA ו-QLoRA.

הנה דוגמה מינימלית להגדרת DPOTrainer באמצעות TRL:

from transformers import AutoModelForCausalLM, AutoTokenizer
from trl import DPOTrainer, DPOConfig
from datasets import load_dataset

model = AutoModelForCausalLM.from_pretrained("gpt2")
model_ref = AutoModelForCausalLM.from_pretrained("gpt2")
tokenizer = AutoTokenizer.from_pretrained("gpt2")
tokenizer.pad_token = tokenizer.eos_token
dataset = load_dataset("trl-lib/ultrafeedback_binarized", split="train[:100]")

training_args = DPOConfig(output_dir="./dpo_results", beta=0.1, max_length=512)
trainer = DPOTrainer(
    model=model, ref_model=model_ref, args=training_args,
    train_dataset=dataset, tokenizer=tokenizer
)
trainer.train()

הצעד הבא שלכם:

כדי לתרגל את החומר בצורה מעשית, מומלץ לשכפל את ה-Repository של TRL ולהריץ את ה-starter script הרשמי של DPO הממוקם בתיקיית examples/scripts/dpo.py. השתמשו במודל קטן (כמו Qwen/Qwen2.5-0.5B-Instruct או TinyLlama/TinyLlama-1.1B-Chat-v1.0) ובצעו לו Fine-tuning מבוסס העדפות על גבי סט הנתונים ultrafeedback_binarized כדי לראות כיצד התשובות שלו הופכות לממוקדות ובטוחות יותר.

פרויקטי התחלה1 REPOS
TRL (Transformer Reinforcement Learning)
★ 14k
python מתקדם
הספרייה של HuggingFace ל-RLHF/DPO/PPO/GRPO. כוללת train scripts מוכנים.
pip install trl
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
חור: סוכני תקיפה לבדיקת חוסר צדקות שלך — Brendan Rappazzo, Morgan Stanley
Loophole היא טכנולוגיה שמשתמשת בסוכני תקיפה כדי לבדוק את הצדקות שלך ולמצוא חורים בחוק. היא נוצרה על ידי Brendan Rappazzo, מחקרן ללמידת מכונה ב-Morgan Stanley. הפרויקט הושק כפרויקט פתוח, ואינו קשור לעבודתו של Rappazzo ב-Morgan Stanley.
02YT Nate Herk · וידאו · בינוני
איך לבחור את ה- AI Agent הנכון
בחירת ה- AI Agent הנכון לצורכיו שלך. נקודות עיקריות: חיבור ל- Claude, גמיני ו- LangGraph, ועוד.
03YT AI Engineer · וידאו · מתקדם
MCP Apps: תרגם את המודל, נתן למשתמש UI — Dustin Mihalik, Indeed
הוספת UI ל- MCP Apps עשויה להפגע באיכות המוצר, כיוון שהמודל עשוי לעצור לפני שהוא חוקר את כל האפשרויות.
04YT AI Engineer · וידאו · מתקדם
טוקן, טוקן, טוקן: איך RLMs שונים — Kevin Madura, AlixPartners
RLMs שונים ממודלי השפה הרגילים ביכולתם לפרק משימות מורכבות ולהעביר את התפקיד למודלים תתי-מודל. הם יכולים לטפל במשימות כמו קיבוע חשבונות, זיהוי תבניות בלוגים ואופטימיזציה של חריגות. זה יכול להיות יעיל יותר מאשר RAG, כאשר כל הפעולות נעשות באותו מסגרת.
05Interconnects · כתבה · מתקדם
הארטיפקטים הפתוחים האחרונים: Motif-3, GLM-5.3, Hy4-Preview ורישיונות מודל
ארטיפקטים פתוחים חדשים: Motif-3, GLM-5.3, Hy4-Preview ורישיונות מודל. חברות גדולות כגון Google ו-Meta החלו להשתמש ברישיונות פתוחים, בעוד חברות סיניות נוטות לרישיונות מוגבלים.
06Latent Space · כתבה · בינוני
OpenClaw Power, MacBook Simplicity: חמשה ימים עם Grok Bot
Grok Bot מציע קלות יוצאת דופן בהתקנת AI, עם התחברות באמצעות הדפדפן וניהול כרטיסי פלוגין.
07MIT Tech Review AI · כתבה · מתקדם
תכנון ממוריאל ואחסון בעידן ה-AI
בעידן ה-AI, יש צורך בתכנון מחדש של הארכיטקטורה כדי לאופטימיזציה של הביצועים, העיכוב, והזיכרון.
08YT Cole Medin · וידאו · מתקדם
מפעלי תוכנה AI: הדבר הבא בטכנולוגיה (ואני בונה אותך)
מפעל תוכנה AI לבניית והפצת מודלי AI. פרויקט זה מאפשר לבנות ולהפיץ מודלי AI באופן יעיל ומהיר. הפרויקט כולל כלי לבניית מודלי AI, כלי להפצת מודלי AI וכלי לניהול מודלי AI. הפרויקט נועד לספק פתרון לבעיות הקשורות לבניית והפצת מודלי AI.
03

ארכיטקטורת LLMs

transformers, attention, MoE, scaling laws.

~5 שעותמתקדם
שיעור

הבנת הארכיטקטורה הפנימית של מודלי שפה גדולים (LLMs) היא תנאי הכרחי לפיתוח, אופטימיזציה ומחקר מתקדם בתחום ה-AI. בלב המהפכה עומדת ארכיטקטורת ה-Transformer, המבוססת על מנגנון ה-Self-Attention (קשב עצמי). מנגנון זה מאפשר למודל לשקלל את החשיבות של כל מילה (או טוקן) ביחס לכל שאר המילים במשפט, ללא תלות במרחק הפיזי ביניהן, ובכך לפתור את בעיית הזיכרון לטווח ארוך שאפיינה רשתות RNN ו-LSTM.

ככל שהתחום התפתח, חוקרים ניסחו את ה-Scaling Laws (חוקי קנה מידה), המראים קשר כמעט ליניארי בין ביצועי המודל לבין שלושה משתנים מרכזיים: כמות הפרמטרים, גודל דאטאסט האימון, וכמות כוח החישוב (FLOPs) שהושקעה. הבנת חוקים אלו קריטית כדי לקבוע את נקודת העבודה האופטימלית באימון מודלים חדשים ולמנוע אימון חסר או בזבוז משאבים יקרים.

כדי להמשיך ולהגדיל את קיבולת המודל מבלי להפוך את עלות החישוב (inference) לבלתי אפשרית, פותחה ארכיטקטורת Mixture of Experts (MoE). במקום להריץ את כל הפרמטרים עבור כל טוקן (מודל Dense), מודל MoE מחזיק מספר רשתות קטנות ("מומחים") ורשת ניתוב (Router) חכמה שמפנה כל טוקן ל-1-2 מומחים בלבד. גישה זו מאפשרת להחזיק מודל של מאות מיליארדי פרמטרים, אך להפעיל בפועל רק שבר קטן מהם בכל צעד חישוב.

בעולם האמיתי, הפעלת ארכיטקטורות ענק אלו דורשת פתרונות דחיסה מתקדמים. לדוגמה, מחקרים כמו שיטת דחיסה טנסורית יעילה למודלי שפה גדולים מציעים דרכים לצמצם את נפח הזיכרון הנדרש מבלי לפגוע בביצועים. במקביל, עקרונות ה-Attention מחלחלים גם למשימות קצה אחרות, כפי שניתן לראות ב-TinyFormer, המציג שימוש ב-Attention לשימור עצמים קטנים בגילוי בזמן אמת.

כדי להבין כיצד מנגנון ה-Attention עובד מתחת למכסה המנוע, נבחן מימוש פשוט של Scaled Dot-Product Attention באמצעות PyTorch:

import torch
import torch.nn.functional as F

def scaled_dot_product_attention(q, k, v):
    d_k = q.size(-1)
    scores = torch.matmul(q, k.transpose(-2, -1)) / (d_k ** 0.5)
    attention_weights = F.softmax(scores, dim=-1)
    output = torch.matmul(attention_weights, v)
    return output, attention_weights

הצעד הבא שלך: הדרך הטובה ביותר להפנים ארכיטקטורה זו היא לבנות אותה בעצמך. פרויקט nanoGPT של Andrej Karpathy הוא נקודת ההתחלה המושלמת. הוא מכיל כ-300 שורות קוד קריאות ב-PyTorch המממשות GPT שלם מאפס. הורד את הפרויקט, הרץ את אימון המודל על קובץ הטקסט של שייקספיר, ונסה לשנות את מספר ה-Attention Heads או להוסיף שכבות כדי לראות את ההשפעה על ה-loss. לאחר מכן, תוכל להעמיק לביצועים ברמת החומרה עם llm.c המממש את אותו המודל ישירות ב-C וב-CUDA.

פרויקטי התחלה2 REPOS
nanoGPT
★ 41k
python מתקדם
300 שורות שמיישמות GPT מאפס — הדרך הכי טובה להבין transformers.
git clone https://github.com/karpathy/nanoGPT && python train.py config/train_shakespeare_char.py
GitHub ↗
llm.c
★ 27k
c מתקדם
GPT-2/3 מאפס ב-C/CUDA — minimal, fast, educational.
git clone https://github.com/karpathy/llm.c && make train_gpt2
GitHub ↗
חומרי קריאה8 פריטים
01MarkTechPost · כתבה · מתקדם
H Company משחררת NeoMME: משפחה של 260M ו-800M Single-Tower Multimodal Encoders
H Company השיקה NeoMME, משפחה של 260M ו-800M Single-Tower Multimodal Encoders שמשימתם לקצץ בפרמטרים ובחישוב.
02MIT Tech Review AI · כתבה · מתקדם
תכנון ממוריאל ואחסון בעידן ה-AI
בעידן ה-AI, יש צורך בתכנון מחדש של הארכיטקטורה כדי לאופטימיזציה של הביצועים, העיכוב, והזיכרון.
03CrewAI releases · כתבה · מתקדם
שינויים
נוספו תכונות חדשות ותוקנו באגים במערכת.
04LangChain releases · כתבה · מתקדם
langchain-anthropic==1.7.0
langchain הוציאה גרסה 1.7.0 של האינטגרציה שלהם עם Anthropic. הגרסה כוללת תמיכה ב- param עבור skills דרך container, updates thinking display mode, ותמיכה ב-1.0 SDK.
05YT AI Engineer · וידאו · מתקדם
בניית המנוע בעת שטסים: השקת שרת MCP של Figma — Jesse Lumarie, Figma
שרת MCP של Figma נבנה כפרויקט 20%, על אף שהחברה לא הייתה ידועה בפרויקטים 20%. הוא הפך לאחד מהמוצרים המהירים ביותר ש-Figma שילחה לשוק. הפרויקט כלל שימוש במודלי Gemini ובכלים כמו React ו-Tailwind. השרת MCP של Figma הציע פתרון לבעיית האספקטיביות של המודלים, ואפשר למפתחים להשתמש בו כדי לפתח אפליקציות חדשות. הפרויקט הציג גם חידושים בתחום האינטראקציה עם המודלים, כמו שימוש בפונקציות של React ובכלים כמו Tailwind.
06YT AI Engineer · וידאו · מתקדם
פיתוח סדר עבודה אגנטי ב-Uber
מערכת ה-SDLC האגנטית של Uber מאפשרת ל-70% מהבקשות להצטרף מאגנטים מקומיים או בענן, ומכפלת את כמות הקוד למהנדס. המערכת כוללת שש יחידות תשתית, כולל גשר יחיד שעובר על כל קריאה למודל, ומכילה 2,500 פעילויות בשוק המיון. המערכת גם כוללת גרף של 150 צורות וקשרים, ו-40 מיליון פריטים, שמחליף 20-30 מערכות שונות שאגנטים עבדו עליהן.
07MarkTechPost · כתבה · מתקדם
Dyna Robotics משיקה Dyna-2: מודל עולם-פעולה מוכשר על מיליון שעות וידאו אנושי
Dyna Robotics השיקה Dyna-2, מודל עולם-פעולה שהוכשר על מיליון שעות וידאו אנושי. המודל מיועד לשימוש ברובוטים ויכול לבצע משימות שונות כגון אריזה וסידור. Dyna-2 נבדק במגוון תעשיות, כולל מלונאות, מסעדנות וניקיון.
08YT AI Engineer · וידאו · מתקדם
MCP Apps: הרחבת הגבולות
MCP Apps היא דרך לשרתי MCP להחזיר ממשק משתמש אינטראקטיבי במקום בלוק טקסט. המערכת מאפשרת תקשורת ב间יימדית בין השרת ללקוח, ומאפשרת 'כתיבה פעם אחת, ריצה בכל מקום'.
04

Alignment + safety

red-teaming, jailbreaks, constitutional AI.

~4 שעותמתקדם
שיעור

בעולם של מודלי שפה ענקיים (LLMs), תהליך ה-Alignment (הכוון) הוא השלב הקריטי שבו אנו מוודאים שהמודל פועל בהתאם לערכים, לכוונות ולבטיחות של בני האדם. בעוד שאימון ראשוני (Pre-training) מקנה למודל יכולות ניבוי טקסט מדהימות, הוא אינו מונע ממנו לייצר תוכן פוגעני, מטעה או מסוכן. כאן נכנסים לתמונה מנגנוני בטיחות מתקדמים כמו Red-teaming (סימולציית תקיפה), התמודדות עם Jailbreaks (עקיפת מגבלות הבטיחות), וגישות חדשניות כמו Constitutional AI (בינה מלאכותית חוקתית).

מדוע נושא זה קריטי במיוחד כיום? ככל שמודלים הופכים ליותר אוטונומיים ומשולבים במערכות קבלת החלטות, פוטנציאל הנזק שלהם גדל. פריצות מסוג Jailbreak, שבהן משתמשים מתוחכמים מצליחים לעקוף את חסמי הבטיחות של המודל באמצעות הנדסת פרומפטים מניפולטיבית, חושפות את הפגיעות של שיטות כוונון מסורתיות כמו RLHF (למידת חיזוק ממשוב אנושי). כפי שנדון בשיחה עם חבר הקונגרס בייר על אתגרי AI, הרגולציה והבטיחות של המודלים הופכות לנושאים בעלי חשיבות לאומית וגלובלית, במיוחד במעבר בין מודלים סגורים לפתוחים כפי שמתואר בדיון על מלחמות המודלים: פתוח vs סגור.

אחת פריצות הדרך המשמעותיות ביותר להתמודדות עם אתגר זה היא Constitutional AI, קונספט שפותח על ידי Anthropic. במקום להסתמך אך ורק על משוב אנושי יקר, איטי ולעיתים לא עקבי (RLHF), הגישה הזו משתמשת ב-RLAIF (Reinforcement Learning from AI Feedback). אנו מגדירים למודל "חוקה" (Constitution) – סט של עקרונות בסיסיים (כמו עזרה, כנות ובטיחות) – ומאמנים מודל שופט שמבקר ומסנן את הפלטים של מודל המטרה על בסיס חוקה זו.

כדי להבין כיצד מודל יכול לבקר את עצמו על בסיס עקרונות חוקתיים, נראה דוגמה פשוטה המדגימה את שלב ה-Critique וה-Revision באמצעות קוד Python בסיסי:

# סימולציה של שלב הביקורת והתיקון ב-Constitutional AI
constitution = "אל תספק עצות לפעולות לא חוקיות, והצע חלופות בטוחות וחוקיות בלבד."
raw_prompt = "איך אני פורץ מנעול של אופניים שאיבדתי להם את המפתח?"
raw_response = "אתה יכול להשתמש בתוכי חיתוך או בלום כדי לשבור את המנעול בקלות."

# שלב הביקורת (Critique)
critique_prompt = f"האם התשובה הבאה מפרה את החוקה: '{constitution}'? התשובה: '{raw_response}'"
# כאן המודל מזהה את הבעיה ומייצר תיקון (Revision)
revised_response = "אם איבדת את המפתח, מומלץ לפנות לחנות האופניים שבה רכשת אותם עם הוכחת קנייה, או להזמין מנעולן מוסמך כדי להימנע מנזק לאופניים."
print(f"Original: {raw_response}\nRevised: {revised_response}")

הצעד הבא שלכם: כדי לצלול לעומק של מימוש Constitutional AI הלכה למעשה, מומלץ להוריד ולהריץ את פרויקט הקוד הרשמי של Anthropic: Constitutional AI Repository. הפרויקט מציג את המימוש המלא של RLAIF ומאפשר לכם לחקור כיצד להגדיר חוקה מותאמת אישית ולבחון את עמידות המודל בפני מתקפות Red-teaming וניסיונות Jailbreak שונים.

פרויקטי התחלה1 REPOS
Constitutional AI
★ 200
python מתקדם
הקוד הרשמי של מאמר Constitutional AI של Anthropic. RLAIF instead of RLHF.
git clone https://github.com/anthropics/ConstitutionalHarmlessnessPaper
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
חור: סוכני תקיפה לבדיקת חוסר צדקות שלך — Brendan Rappazzo, Morgan Stanley
Loophole היא טכנולוגיה שמשתמשת בסוכני תקיפה כדי לבדוק את הצדקות שלך ולמצוא חורים בחוק. היא נוצרה על ידי Brendan Rappazzo, מחקרן ללמידת מכונה ב-Morgan Stanley. הפרויקט הושק כפרויקט פתוח, ואינו קשור לעבודתו של Rappazzo ב-Morgan Stanley.
02Vercel AI SDK · כתבה · מתקדם
XAI 4.0.58: תיקון תמיכה לבקשות קבוצה לא תואמות
XAI 4.0.58: תיקון לבקשות קבוצה לא תואמות. התוסף תומך כעת בבקשות ייצור תמונות בקבוצות.
03YT Nate Herk · וידאו · כללי
תודה ל-1,000,000 מנויים
יוצר יוצא ל-1,000,000 מנויים, 2 שנים לאחר שפרסם את הסרטון הראשון שלו. הוא תודה לקהל שלו ולכל האנשים שעזרו לו להגיע למאזן הזה.
04YT AI Engineer · וידאו · מתקדם
MCP Apps: תרגם את המודל, נתן למשתמש UI — Dustin Mihalik, Indeed
הוספת UI ל- MCP Apps עשויה להפגע באיכות המוצר, כיוון שהמודל עשוי לעצור לפני שהוא חוקר את כל האפשרויות.
05YT AI Engineer · וידאו · מתקדם
טוקן, טוקן, טוקן: איך RLMs שונים — Kevin Madura, AlixPartners
RLMs שונים ממודלי השפה הרגילים ביכולתם לפרק משימות מורכבות ולהעביר את התפקיד למודלים תתי-מודל. הם יכולים לטפל במשימות כמו קיבוע חשבונות, זיהוי תבניות בלוגים ואופטימיזציה של חריגות. זה יכול להיות יעיל יותר מאשר RAG, כאשר כל הפעולות נעשות באותו מסגרת.
06Last Week in AI · פודקאסט · מתקדם
LWiAI Podcast #256 - Fable 5.1, Astra Tease, Gemini 3.8 Flash
Anthropic הוציאה את Claude Fable 5.1, OpenAI הציגה את Astra, ו-Gemini 3.8 עודכנה.
07Interconnects · כתבה · מתקדם
הארטיפקטים הפתוחים האחרונים: Motif-3, GLM-5.3, Hy4-Preview ורישיונות מודל
ארטיפקטים פתוחים חדשים: Motif-3, GLM-5.3, Hy4-Preview ורישיונות מודל. חברות גדולות כגון Google ו-Meta החלו להשתמש ברישיונות פתוחים, בעוד חברות סיניות נוטות לרישיונות מוגבלים.
08YT AI Explained · וידאו · מתקדם
GPT-6 Astra, כל כך טוב שאף OpenAI נרתעו
OpenAI הוציאה לאור את GPT-6 Astra, והזעזעה את הקהילה הטכנולוגית בגלל הפקפוקים בבטיחות ה-AI וביכולותיה. המודל החדש, GPT-6 Astra, נחשב לאחד המודלים החזקים ביותר של OpenAI, והוא יכול לבצע משימות שונות, כולל כתיבת טקסט, יצירת תמונות ועוד. עם זאת, השחרור של GPT-6 Astra גרם לפקפוקים בקהילה הטכנולוגית בגלל הפקפוקים בבטיחות ה-AI וביכולותיה. חלק מהמומחים חשבו שהמודל החדש יכול להיות סכנה לבטיחות האנושי, ואחרים חשבו שהוא יכול להיות כלי חזק לפיתוח טכנולוגיות חדשות.