יום חמישי, 30 ביולי 2026 LIVE
AI־INFO

היסטוריה

RLHF — איך מודל לומד להיות שימושי במקום סתם חכם

מ-InstructGPT (2022) ועד Constitutional AI: הסוד מאחורי הפיכת LLM ל-ChatGPT/Claude

AI־INFO · עריכה 11 דק׳ קריאה

RLHF — איך מודל לומד להיות שימושי במקום סתם חכם

כאשר אנו מזינים למודל שפה גדול (LLM) גולמי, שאומן על טקסטים מרחבי הרשת, את השאלה "How do I bake a cake?", התוצאה עלולה לאכזב. במקום לקבל מתכון מפורט וברור, המודל הגולמי עלול להמשיך את הטקסט באופן הבא: "...is a common question on cooking forums..." (זוהי שאלה נפוצה בפורומי בישול). הסיבה לכך נעוצה בליבת תהליך האימון שלו: שלב ה-Pre-training אופטימלי לניבוי הטוקן הבא (next-token prediction), אך הוא אינו מתוכנן לספק תשובות מועילות למשתמשים. כדי לגשר על הפער הזה, ולגרום למודל להיות שימושי ולא רק "חכם", נדרשת שיטה שתבצע אופטימיזציה על בסיס העדפות אנושיות. הפתרון שנמצא לכך, והפך לעמוד התווך של הבינה המלאכותית המודרנית, הוא RLHF (Reinforcement Learning from Human Feedback) — למידת חיזוק ממשוב אנושי.

השורשים ההיסטוריים של המהפכה

הקונספט של למידת חיזוק ממשוב אנושי לא נולד עם מודלי השפה הגדולים. בשנת 2017, Christiano et al. (בשיתוף פעולה של OpenAI ו-DeepMind) הציגו את המאמר פורץ הדרך "Deep Reinforcement Learning from Human Preferences". במחקר זה יושמה שיטת RLHF המקורית על משחקי Atari, כאשר סוכני תוכנה אומנו באמצעות השוואות שביצעו בני אדם בין קטעי וידאו של משחקים.

הקפיצה המשמעותית הבאה התרחשה בשנת 2019, כאשר Stiennon et al. מ-OpenAI הציגו את השימוש ב-RLHF לצורך תמצות טקסט (text summarization) — היישום המשמעותי הראשון של השיטה על שפה כתובה. פריצת הדרך המכוננת שהניחה את היסודות ליישור (alignment) של מודלי שפה מודרניים הגיעה במרץ 2022, עם פרסום המאמר "Training language models to follow instructions with human feedback" על ידי Ouyang et al. מ-OpenAI (הידוע כמאמר ה-InstructGPT).

המתכון התלת-שלבי של RLHF

הפיכת מודל שפה גולמי לעוזר מועיל מבוססת על תהליך מובנה בן שלושה שלבים:

שלב 1 — כוונון עדין מונחה (Supervised Fine-Tuning - SFT):

בשלב זה, החברה שוכרת קבלני משנה אנושיים לכתיבת כ-10,000 עד 15,000 דוגמאות של הנחיות ותשובות אידיאליות. עבור כל פרומפט, נכתבת התגובה המושלמת. המודל שאומן מראש (pre-trained) עובר כוונון עדין (fine-tune) על זוגות אלו של קלט ופלט. התוצאה היא מודל שמסוגל לעקוב אחר הוראות, אך איכות ביצועיו עדיין אינה אחידה.

שלב 2 — מודל תגמול (Reward Model - RM):

עבור כל פרומפט, מייצרים 4 עד 9 תגובות שונות באמצעות מודל ה-SFT. מעריכים אנושיים מדרגים את התגובות הללו מהטובה ביותר לגרועה ביותר. על בסיס דירוגים אלו, מאמנים מודל תגמול (לרוב מודל שפה קטן יותר) באמצעות פונקציית הפסד זוגית מסוג Bradley-Terry. התוצאה היא מודל שמקבל פרומפט ותגובה, ומפיק ציון איכות סקלרי ("quality score").

שלב 3 — אופטימיזציית למידת חיזוק (RL Optimization - PPO):

בשלב הסופי, משתמשים באלגוריתם Proximal Policy Optimization (PPO) כדי לכוונן עדין את מודל ה-SFT. אות התגמול (reward signal) מורכב מהציון של מודל התגמול, פחות קנס סטיית KL (KL-divergence penalty) ממדיניות ה-SFT המקורית. קנס זה חיוני כדי למנוע "פריצת תגמול" (reward hacking) ויצירת ג'יבריש. התוצאה היא מודל מדיניות (policy model) המקבל ציונים גבוהים במודל התגמול, ובכך מיושר עם ההעדפות האנושיות.

תרשים תהליך RLHF: pre-training, SFT, reward model, PPOתרשים תהליך RLHF: pre-training, SFT, reward model, PPO

כל אחד מהשלבים הללו ממלא תפקיד קריטי. אימון SFT לבדו מייצר מודל מועיל אך גנרי, שאינו מסוגל ללמוד העדפות מורכבות ומעודנות. מודל התגמול (RM) לבדו אינו מסוגל לייצר טקסט, אלא רק לדרג פלטים קיימים. שלב ה-RL (למידת החיזוק) הוא זה שמגשר על הפער, אך הוא יכול לעבוד אך ורק בזכות קיומו של מודל התגמול שמדרג את הדגימות החדשות.

פריצת הדרך הגדולה ועידן ה-ChatGPT

במאמר ה-InstructGPT מ-2022 (Ouyang et al.) נחשף גילוי דרמטי ששינה את פני התעשייה: מודל InstructGPT בעל 1.3 מיליארד פרמטרים בלבד, שעבר תהליך RLHF, זכה להעדפה על פני מודל הבסיס הענק GPT-3 בעל 175 מיליארד פרמטרים. התובנה לפיה "מודל קטן ומיושר" מנצח "מודל ענק לא מיושר" הפכה לתובנה השולטת בתחום, וסימנה את הרגע שבו מחקר היישור (alignment) נכנס למיינסטרים.

בנובמבר 2022, OpenAI יישמה את שיטת ה-RLHF על בסיס חזק יותר (GPT-3.5) והוסיפה פורמט של שיחה (ניהול תורות ופרומפט מערכת). הגישה הציבורית החינמית שהוענקה ל-ChatGPT הובילה לפיצוץ בשימוש, כאשר איכות היישור שלו הפכה אותו ל-"AI שעובד".

החלופות והאבולוציה: מ-Constitutional AI ועד DPO

בדצמבר 2022, חברת Anthropic הציגה גישה אלגנטית חלופית במאמר של Bai et al., המכונה Constitutional AI. גישה זו מחליפה את שלב 2 (הדירוג האנושי) בדירוג המבוצע על ידי בינה מלאכותית (RLAIF — Reinforcement Learning from AI Feedback). התהליך נשען על "חוקה" (constitution) — רשימה של עקרונות כתובים כגון "Avoid producing harmful content" או "Be honest". המודל מבצע ביקורת עצמית ומעדכן את פלטיו בהתאם לחוקה זו. שיטה זו הפחיתה דרמטית את הצורך בעבודה אנושית, והיא זו שמניעה את מודלי Claude מאז שנת 2023.

בשנת 2023, Rafailov et al. מאוניברסיטת Stanford הציגו פריצת דרך נוספת: Direct Preference Optimization (DPO). החוקרים הראו כי ניתן לוותר לחלוטין על שלב מודל התגמול המפורש. במקום זאת, נעשה שימוש ישיר בנתוני ההעדפה בשלב כוונון עדין יחיד, השקול מתמטית לתהליך ה-RLHF. שיטה זו פשוטה יותר, זולה יותר ויציבה יותר, ואומצה במהירות על ידי מודלים מובילים כמו Llama 3 של Meta (בשנת 2024), Mistral ואחרים.

האתגרים שבדרך והחזית הנוכחית

למרות ההצלחה, הכלים הללו מתמודדים עם בעיות משמעותיות בעולם האמיתי:

בחזית המחקר הנוכחית (שנים 2025-2026), שיטת DPO וגרסאותיה (כמו KTO ו-IPO) מחליפות את PPO במרבית מעבדות המחקר. בנוסף, מפותחות שיטות כמו RLHF מונחה-תהליך (Process-supervised RLHF) המעניק תגמול על שלבי חשיבה בודדים (chain-of-thought) ולא רק על התשובה הסופית, וכן RLHF בהקשר ארוך (Long-context RLHF) עבור מודלי חשיבה מתקדמים (כמו o1, Claude Extended Thinking ו-DeepSeek R1). לבסוף, מודלי שפה בעלי תגמול עצמי (Self-rewarding language models), שבהם המודל שופט את הפלטים של עצמו (כפי שהציגה Meta בשנת 2024), מסמנים את עתיד התחום.

מקורות

  1. Deep Reinforcement Learning from Human Preferences (Christiano et al., 2017)
  2. Training language models to follow instructions with human feedback (Ouyang et al., 2022)
  3. Constitutional AI: Harmlessness from AI Feedback (Bai et al., 2022)
  4. Direct Preference Optimization (Rafailov et al., 2023)

— סוף הכתבה —

חזרה לארכיון ↗