DeepSeek R1 — ינואר 2025 והרגע שבו open-source הדביק את הפרונטיר
מודל reasoning סיני שעלה פחות מ-6M$ לאמן ושוחרר MIT — והכניס לפאניקה את שוק ההון האמריקאי
בינואר 2025 השתנה מאזן הכוחות העולמי בתחום הבינה המלאכותית לתמיד. הרגע שבו מעבדת מחקר סינית קטנה ופתוחה הצליחה להדביק את הפער מול ענקיות הטכנולוגיה של עמק הסיליקון ייזכר כאחת מנקודות המפנה המשמעותיות ביותר בהיסטוריה הטכנולוגית. שחרורו של המודל DeepSeek R1 ניפץ את הקונסנזוס לפיו פיתוח בינה מלאכותית מתקדמת (frontier AI) מחייב תקציבי עתק של מאות מיליוני דולרים ותשתיות מחשוב אינסופיות, והוכיח כי יעילות אלגוריתמית מבריקה וקוד פתוח (open-source) יכולים לקרוא תיגר על המודלים הסגורים והיקרים ביותר בעולם.
מערכה ראשונה: קרן הגידור השקטה מהאנגז'ו
הסיפור של DeepSeek AI אינו מתחיל במעבדות של סן פרנסיסקו, אלא בעיר האנגז'ו שבסין. החברה פועלת כחברת בת של High-Flyer, קרן גידור כמותית (quantitative hedge fund) סינית מובילה. היא הוקמה על ידי Liang Wenfeng (יליד 1985), בוגר לימודי מתמטיקה ופיזיקה, שבנה את High-Flyer באמצעות שימוש בלמידת מכונה (ML) למסחר בשווקים הפיננסיים. עוד לפני שהממשל האמריקאי הטיל מגבלות ייצוא חמורות על שבבים מתקדמים באוקטובר 2022, השכילה High-Flyer לאגור מלאי עצום של למעלה מ-10,000 מעבדי NVIDIA A100.
עם המשאב היקר הזה, Liang הקים את DeepSeek כמעבדת מחקר בעלת עצמאות מחקרית מלאה. הצהרת הכוונות שלו הייתה ברורה: "AGI, not products" (בינה מלאכותית כללית, לא מוצרים). כדי לממש את החזון, החברה גייסה צוות מצומצם אך מבריק, המורכב בעיקר מבוגרי דוקטורט טריים מהאוניברסיטאות המובילות בסין, תוך מתן משכורות הגבוהות פי 2 עד 3 מממוצע השוק. המעבדה פעלה מתחת לרדאר העולמי, עד לרגע שבו החליטה להציג לעולם את פירות עבודתה.
מערכה שנייה: פריצת הדרך הטכנולוגית ורגע ה-"Aha"
ב-20 בינואר 2025, שחררה המעבדה את המאמר פורץ הדרך "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning" (Guo et al., arXiv 2501.12948). המודל שוחרר תחת רישיון MIT פתוח לחלוטין, כולל משקולות המודל (weights), המאמר וצינור האימון (training pipeline). עלות האימון המדווחת של מודל הבסיס (DeepSeek-V3) עמדה על 5.6 מיליון דולר בלבד, כאשר כוונון ההסקה של R1 בוצע מעליו. לשם השוואה, עלות האימון של OpenAI o1 מוערכת בלמעלה מ-100 מיליון דולר.
הבסיס למהפכה היה DeepSeek-V3, ששוחרר בדצמבר 2024. מודל זה, בעל 671 מיליארד פרמטרים (671B parameters) בארכיטקטורת Mixture of Experts (MoE) עם 37 מיליארד פעילים לטוקן (37B active per token), הציג חידושים כמו דחיסת קשב Multi-head Latent Attention (MLA), התמחות מומחים DeepSeekMoE, וחיזוי מולטי-טוקנים במקביל (Multi-Token Prediction - MTP) על פני 14.8 טריליון טוקנים (14.8T tokens).
על בסיס זה פותח תחילה DeepSeek-R1-Zero — מודל למידת חיזוק טהורה (pure RL) ללא SFT וללא RLHF, שהסתמך על תגמולים מבוססי כללים (rule-based rewards) לנכונות במתמטיקה וקוד. הניסוי הציג התנהגויות הסקה ספונטניות (emergent reasoning) כמו אימות עצמי ויצירת שרשראות מחשבה ארוכות (chains-of-thought). דפי המאמר שהציגו את רגע ה-"Aha" הפכו לוויראליים, כשהמודל כתב באמצע הפתרון: "Wait, let me rethink that". עם זאת, R1-Zero סבל מבעיות קריאות וערבוב שפות.
כדי לפתור זאת, פותח המודל המלוטש DeepSeek-R1. החוקרים הוסיפו שלב "התנעה קרה" (cold-start) מונחה (SFT) על כמה אלפי דוגמאות של שרשראות מחשבה ארוכות. התהליך הפך לרב-שלבי: SFT, לאחר מכן RL, סינון דוגמאות (rejection sampling), SFT נוסף וסבב RL נוסף. המודל השיג שוויון ביצועים (parity) מול OpenAI o1 במתמטיקה (AIME, MATH-500), בכתיבת קוד (Codeforces) ובהסקה (MMLU) — וכל זאת תוך עלויות הרצה (inference) זולות בהרבה.
מערכה שלישית: רעידת האדמה בשווקים ועידן ה-Distillation
ההשפעה של DeepSeek R1 חרגה במהירות מגבולות קהילת המחקר. ב-27 בינואר 2025, מניית NVIDIA צנחה ב-17% ביום מסחר בודד — ירידת ערך השוק היומית הגדולה בהיסטוריה, שמחקה כ-600 מיליארד דולר מהחברה. הנפילה נגרמה לאחר שהמשקיעים הבינו כי בינה מלאכותית מתקדמת אינה מחייבת רכישה אינסופית של מעבדים יקרים. מניות חומרה מובילות אחרות, בהן AMD, TSMC ו-Broadcom, חוו אף הן ירידות שערים חדות, וחברי קונגרס בארה"ב קיימו שימועים דחופים וקראו להחמרת מגבלות הייצוא.
סם אלטמן (Sam Altman) הגיב בטוויטר: "deepseek's r1 is an impressive model... we will obviously deliver much better models".
אך הבשורה הגדולה ביותר הייתה הזיקוק (Distillation). מעבדת DeepSeek שחררה גרסאות מבוססות זיקוק: R1-Distill-Qwen-7B, R1-Distill-Llama-8B ו-R1-Distill-Llama-70B, שאומנו על פלטי החשיבה של R1 הגדול. להפתעת התעשייה, אפילו גרסת ה-7B הקטנה הצליחה להשתוות ל-GPT-4o במדדי הסקה מסוימים, ובכך הפכה יכולות חשיבה ברמת פרונטיר לנגישות להרצה על גבי כרטיס מסך (GPU) צרכני יחיד.
ההצלחה הזו התרחשה על רקע המאמצים הגיאופוליטיים של ארה"ב להאט את פיתוח ה-AI בסין באמצעות מגבלות הייצוא של אוקטובר 2022 ו-2023. הצלחתה של DeepSeek התפרשה כהוכחה לכך שמגבלות הייצוא נכשלו, או שהמגבלות עצמן דחפו את החוקרים הסינים ליעילות אלגוריתמית יוצאת דופן. מעבדות סיניות נוספות כמו Qwen, Yi ו-Doubao הציגו מסלולים דומים.
מפת הדרכים החדשה: מה הוכח ומה נותר פתוח?
שחרורו של DeepSeek R1 הוכיח ארבעה עקרונות יסוד חדשים:
- למידת חיזוק טהורה (pure RL) על גבי מערכות תגמול ברות-אימות (כמו מתמטיקה וקוד) מסוגלת לחלץ יכולות חשיבה והסקה מתקדמות גם ללא צורך ב-SFT מקדים.
- יכולת החשיבה וההסקה היא תכונה הניתנת להעברה וללימוד למודלים קטנים יותר באמצעות תהליך של זיקוק (distillation).
- מודלים בקוד פתוח (open-source) מסוגלים לעמוד בקצב של חזית הטכנולוגיה, לפחות בכל הקשור ליכולות הסקה.
- תזת ה-"scaling laws" (חוקי קנה המידה) המבוססת על הגדלה אינסופית של כוח מחשוב ומודלים סגורים אינה הנתיב היחיד להתקדמות.
עם זאת, פריצת הדרך לא פתרה את כל השאלות. מודלים סגורים עדיין מסוגלים להתרחב ולשמור על יתרון (כפי שהוכיחו מודלים כמו o3 ו-o4 של OpenAI, או Claude Extended Thinking 4.7). בנוסף, יכולות המולטי-מודאליות והשימוש בכלים (tool use) של R1 נותרו חלשות יותר בהשוואה למודלים הסגורים המובילים. כמו כן, טענת עלות האימון המופחתת (5.6 מיליון דולר) אינה כוללת את עלויות התשתית, המשכורות והניסויים הכושלים הרבים שקדמו להרצה המוצלחת.
ההשפעה ארוכת הטווח של המודל המשיכה להדהד לאורך שנת 2025. בפברואר 2025 השיקה החברה את האפליקציה הצרכנית שלה, שהגיעה במהירות למקום הראשון בחנות האפליקציות (App Store). במאי 2025 הוכרז המודל העוקב DeepSeek-R2, שהציג יכולות מולטי-מודאליות משופרות. במהלך השנים 2025-2026, עשרות מעבדות קוד פתוח מובילות (ובהן Alibaba/Qwen, Mistral ו-Hugging Face) שחררו גרסאות משלהן למודלי הסקה בסגנון R1. עולם הבינה המלאכותית הפך לרב-קוטבי (multipolar), ומרכז הכובד הטכנולוגי התפזר באופן שלא יאפשר עוד לאף חברה בודדת להחזיק במונופול על החשיבה הממוחשבת.
מקורות
— סוף הכתבה —
חזרה לארכיון ↗