GPT-3 ל-ChatGPT — שנתיים שהפכו AI ממחקר לתופעה תרבותית
מיוני 2020 ועד נובמבר 2022: 175 מיליארד פרמטרים, ממשק צ'אט פשוט, ו-100 מיליון משתמשים בחודשיים
GPT-3 ל-ChatGPT — שנתיים שהפכו AI ממחקר לתופעה תרבותית
במשך עשרות שנים, בינה מלאכותית (AI) הייתה נחלתן של מעבדות מחקר סגורות, מדעני מחשב ואלגוריתמים מורכבים שנותרו רחוקים מעינו של הציבור הרחב. הכל השתנה בטווח של פחות משנתיים וחצי. המעבר ההיסטורי מהשקת מודל השפה GPT-3 ביוני 2020 ועד לשחרורו הדרמטי של ChatGPT בנובמבר 2022 לא היה רק קפיצת מדרגה טכנולוגית, אלא מהפכה תפיסתית ששינתה את האופן שבו האנושות מתקשרת עם מכונות. זהו סיפור על טכנולוגיה פורצת דרך, שינוי אריזה גאוני, והרגע שבו ה-AI הפכה מנושא למחקר אקדמי לשיחת היום סביב שולחן האוכל.
יוני 2020: ענק ה-175 מיליארד מתעורר
ב-28 במאי 2020, קבוצה של 31 חוקרים ממעבדת OpenAI פרסמה באתר arXiv מאמר פורץ דרך בשם "Language Models are Few-Shot Learners". המאמר, שהוצג בהמשך בוועידת NeurIPS 2020 וזכה בפרס המאמר הטוב ביותר (Best Paper), הובל על ידי Tom B. Brown (שלימים הפך למייסד שותף של Anthropic) ורשימה ארוכה של חוקרים בולטים ובהם Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever ו-Dario Amodei.
המודל שהוצג, GPT-3, היה מפלצת טכנולוגית במונחי הימים ההם: ארכיטקטורת Transformer מסוג decoder-only בעלת 96 שכבות ו-175 מיליארד פרמטרים. הוא אומן על כ-300 מיליארד טוקנים (tokens) שנאספו מתוך מאגרי מידע עצומים כמו Common Crawl, WebText2, Books1, Books2 ו-Wikipedia. עלות האימון של המודל, שהתבצע על גבי מעבדי V100 GPUs, הוערכה בכ-4.6 מיליון דולר.
הבשורה הגדולה של GPT-3 הייתה היכולת לבצע משימות "בתוך ההקשר" (in-context) באמצעות דוגמאות בודדות בלבד (Few-shot learning), ללא צורך בכוונון עדין (fine-tuning) של המשקולות. כאשר נפתחה הגישה לבטא הסגורה של ה-API ב-11 ביוני 2020 לכ-10,000 מפתחים ראשונים, הרשתות החברתיות, ובעיקר Twitter, התפוצצו מצילומי מסך והדגמות של כתיבת קופי, יצירת קוד ומפגשים פילוסופיים מרתקים עם המכונה. הניסויים של Gwern Branwen ביצירת שירה הפכו לוויראליים, ורבים בתעשייה הבינו לראשונה כי עצם הגדלת קנה המידה (scale) מייצרת יכולות איכותיות חדשות לחלוטין. לצד ההתלהבות, עלו גם ביקורות נוקבות על הזיות (hallucinations), הטיות מובנות בנתוני האימון, סוגיות זכויות יוצרים וצריכת האנרגיה המסיבית.
מרץ 2022: המהפכה השקטה של ה-RLHF
למרות היכולות המרשימות של GPT-3, הוא עדיין היה קשה לשימוש עבור האדם הממוצע. המודל נטה לפלוט טקסטים פראיים, לחזור על עצמו או פשוט לא להבין את כוונת המשתמש. פריצת הדרך האמיתית שפתרה זאת הגיעה במרץ 2022 עם פרסום המאמר "Training language models to follow instructions with human feedback" של Ouyang et al., שהציג לעולם את InstructGPT.
החידוש היה שילוב של למידת חיזוק ממשוב אנושי (RLHF - Reinforcement Learning from Human Feedback) בקנה מידה רחב. התהליך כלל שלושה שלבים: ראשית, כוונון עדין מפוקח (Supervised fine-tuning) על בסיס הדגמות אנושיות; שנית, אימון מודל תגמול (reward model) המבוסס על דירוג העדפות של בני אדם; ושלישית, אופטימיזציית PPO של מודל השפה אל מול מודל התגמול.
התוצאה הייתה מדהימה: מודל InstructGPT בעל 1.3 מיליארד פרמטרים בלבד הועדף על ידי משתמשים אנושיים על פני מודל ה-GPT-3 המקורי בעל 175 מיליארד הפרמטרים. זה היה "הרוטב הסודי" שאיפשר למודל להבין הוראות ולפעול בצורה מועילה ובטוחה יותר.
30 בנובמבר 2022: היום שבו הכל השתנה
ב-30 בנובמבר 2022, בשעה 13:00 (שעון PST), שיחררה OpenAI את ChatGPT כ"תצוגה מקדימה למחקר" (research preview). ההכרזה הרשמית בבלוג של החברה, שנכתבה על ידי Sandhini Agarwal ושותפיה, הציגה מודל המבוסס על גרסה משופרת של GPT-3.5 (שכונתה לעיתים גרסה שאומנה על קוד Codex) בשילוב טכנולוגיית RLHF. הממשק הוצע בחינם לחלוטין, ללא צורך במפתח API, דרך כתובת האתר chat.openai.com.
ההשקה עצמה לוותה בצניעות כמעט מטעה. סם אלטמן (Sam Altman), מנכ
— סוף הכתבה —
חזרה לארכיון ↗