יום שלישי, 15 בספטמבר 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים NVIDIA — לב החומרה של ה-AI
מסלול לימוד

NVIDIA — לב החומרה של ה-AI

CUDA, H100/B100/B200/Blackwell, NVLink, DGX Cloud, Run:ai (acquired). למה NVIDIA שווה $4T ולמה זה אולי לא יחזיק לנצח. גם CUDA basics למפתח.

6 שעות
3 צמתים
בינוני
01

NVIDIA — מ-GPU לגיימרים לחברה הכי שווה בעולם

הסיפור מ-1993 (Jensen Huang + 2), GeForce, CUDA (2006), Tegra, מהפכת ה-AI 2012 עם AlexNet, מ-$100B ל-$4T תוך 5 שנים.

~2 שעותמתחילים
שיעור

סיפורה של חברת NVIDIA הוא אחד המרתקים ביותר בהיסטוריה של הטכנולוגיה. החברה, שהוקמה בשנת 1993 על ידי Jensen Huang ושני שותפיו, החלה את דרכה במטרה לפתור בעיה אחת מוגדרת: הבאת גרפיקה תלת-ממדית למשחקי מחשב. פריצת הדרך הראשונה שלהם הייתה מותג ה-GeForce, שהציג לעולם את המושג GPU (Graphics Processing Unit) - מעבד ייעודי לחישובים מקביליים מורכבים הדרושים לרינדור גרפיקה בזמן אמת.

התפנית הגדולה שהפכה את NVIDIA לענקית שהיא היום התרחשה בשנת 2006 עם השקת ארכיטקטורת CUDA. Jensen Huang הבין שהיכולת של ה-GPU לבצע מיליוני חישובים פשוטים במקביל (בניגוד ל-CPU שמבצע חישובים סדרתיים מורכבים) יכולה לשמש להרבה יותר מאשר רק משחקי מחשב. CUDA אפשרה למדענים ולמפתחי תוכנה לכתוב קוד ישירות ל-GPU בשפות תכנות סטנדרטיות כמו C ו-C++, ובכך פתחה את השער למחשוב על (Supercomputing) נגיש.

בשנת 2012, עולם הבינה המלאכותית השתנה לתמיד בזכות רשת הנוירונים AlexNet. חוקרים גילו שאימון רשתות נוירונים עמוקות (Deep Learning) על גבי כרטיסי המסך של NVIDIA מהיר פי עשרות מונים מאשר על מעבדים רגילים. זו הייתה נקודת המפנה שבה NVIDIA הפכה רשמית למנוע שמאחורי מהפכת ה-AI. מאז, החברה התמקדה בפיתוח שבבים ייעודיים ל-AI, כמו סדרת ה-H100 וה-Blackwell החדשה, מה שהזניק את שווי השוק שלה מ-100 מיליארד דולר לכ-4 טריליון דולר תוך פחות מחמש שנים.

כדי להתחיל לעבוד עם הכלים של NVIDIA בעולם ה-AI, אין צורך לרכוש חומרת קצה יקרה מיד בהתחלה. ספריות פופולריות כמו PyTorch ו-TensorFlow מגיעות עם תמיכה מובנית ב-CUDA. מפתחים מתחילים יכולים להשתמש בפלטפורמות ענן חינמיות כמו Google Colab, המציעות גישה חופשית ל-GPUs של NVIDIA, כדי להריץ ולאמן מודלים של למידה עמוקה בקלות ובמהירות.

הנה דוגמה קצרה בפייתון המציגה כיצד לבדוק האם ספריית PyTorch מזהה את ה-GPU של NVIDIA (באמצעות CUDA) ומעבירה חישוב פשוט אליו:

import torch

# בדיקה האם CUDA זמין במערכת
cuda_available = torch.cuda.is_available()
print(f"Is CUDA available? {cuda_available}")

if cuda_available:
    # קבלת שם כרטיס המסך
    device_name = torch.cuda.get_device_name(0)
    print(f"Using GPU: {device_name}")
    
    # יצירת טנזור והעברתו ל-GPU לביצוע חישוב מהיר
    x = torch.tensor([1.0, 2.0, 3.0]).to("cuda")
    print("Tensor on GPU:", x)

לקריאה נוספת והעמקה, מומלץ לבקר ב-NVIDIA CUDA Programming Guide הרשמי כדי להבין את הארכיטקטורה לעומק, או לקרוא על פרויקט AlexNet on ImageNet שהתחיל את מהפכת הלמידה העמוקה.

הצעד הבא שלכם: פתחו מחברת Google Colab חדשה, שנו את סביבת ההרצה (Runtime) ל-GPU, והריצו את קוד הבדיקה שלמעלה. לאחר מכן, נסו להוריד מודל סיווג תמונות פשוט מ-Hugging Face ולהריץ אותו על ה-GPU כדי לראות את מהירות הביצוע בפועל!

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
02

משפחת H100/B100/B200/Blackwell ו-NVLink

ארכיטקטורת Hopper מול Blackwell, מה זה NVLink 5, GB200 NVL72, DGX SuperPOD. השוואה ל-Cerebras, Groq, TPU. למה כולם תקועים על NVIDIA.

~3 שעותמתקדם
שיעור

בעולם ה-AI המודרני, כוח עיבוד הוא צוואר הבקבוק המרכזי. המעבר מארכיטקטורת Hopper (סדרת H100) לארכיטקטורת Blackwell החדשה (B100, B200) מסמן קפיצת מדרגה דרמטית. בעוד ש-Hopper הציגה ביצועי שיא ביישומי LLM בזכות Tensor Cores מדור רביעי, Blackwell לוקחת את זה לקצה עם תמיכה בפורמט FP4 (דיוק של 4-ביט) ומנוע Transformer Engine דור שני. השיפור אינו רק בליבה הבודדת, אלא ביכולת לחבר מאות ואלפי שבבים יחד כדי שיפעלו כיחידת מחשוב אחת אינטגרלית.

כאן נכנס לתמונה NVLink 5, הדור החמישי של טכנולוגיית הקישוריות של NVIDIA. NVLink 5 מספק רוחב פס דו-כיווני חסר תקדים של 1.8 TB/s לכל GPU, פי 2 מהדור הקודם. פריצת הדרך האמיתית מתבטאת במערכת GB200 NVL72 – ארון שרתים (Rack) שלם המאחד 36 מעבדי Grace CPU ו-72 מעבדי Blackwell GPU. באמצעות NVLink Switch System, המערכת הזו מתנהגת כ-GPU ענק יחיד עם זיכרון משותף (Unified Memory) בנפח של 13.5TB. עבור מודלים בעלי טריליוני פרמטרים, זוהי הדרך היחידה לבצע אימון ואינפרנס ללא צווארי בקבוק של תקשורת רשת סטנדרטית.

כאשר נדרש כוח מחשוב בקנה מידה של מחשב-על, NVIDIA מציעה את ה-DGX SuperPOD. זוהי ארכיטקטורת אשכולות (Clusters) המשלבת מספר מסדי GB200 NVL72 יחד עם קישוריות InfiniBand מהירה ומתגי Quantum-X800. ה-SuperPOD מאפשר לחבר אלפי מעבדים יחד תוך שמירה על יעילות תקשורת גבוהה במיוחד, מה שמקצר את זמני האימון של מודלי הענק משבועות לימים בודדים.

למרות הדומיננטיות של NVIDIA, השוק מציע אלטרנטיבות מעניינות. Cerebras מציגה את גישת ה-Wafer-Scale Engine (WSE-3), שבב ענק יחיד בגודל של פרוסת סיליקון שלמה, המונע לחלוטין את הצורך בתקשורת בין שבבים נפרדים. Groq מציעה ארכיטקטורת LPU (Language Processing Unit) המבוססת על זיכרון SRAM מהיר במיוחד ועיבוד דטרמיניסטי, המצטיין במהירות אינפרנס פנומנלית ל-LLMs. מנגד, ה-TPU (Tensor Processing Unit) של Google מהווה אלטרנטיבה חזקה וזולה יחסית בענן של גוגל. עם זאת, המתחרים הללו סובלים מחסרון מרכזי: הם דורשים התאמות קוד מורכבות ואינם נהנים מהאקוסיסטם הרחב של NVIDIA.

הסיבה שכולם "תקועים" על NVIDIA אינה רק החומרה, אלא בעיקר ה-Moat (החפיר העסקי והטכנולוגי) שנקרא CUDA. פלטפורמת התוכנה של NVIDIA, יחד עם ספריות אופטימיזציה כמו NCCL לתקשורת מבוזרת, הפכה לסטנדרט דה-פקטו בתעשייה. כמעט כל ספריית AI מודרנית (כמו PyTorch או TensorFlow) נכתבת ועוברת אופטימיזציה קודם כל עבור חומרת NVIDIA. המעבר לחומרה מתחרה דורש לעיתים קרובות שכתוב של שכבות תשתית שלמות, סיכון שרוב החברות אינן מוכנות לקחת.

כדי להתחיל לעבוד עם סביבות מבוזרות המנצלות את הקישוריות המהירה של NVIDIA, אנו משתמשים ב-PyTorch Distributed ובספריית NCCL. להלן דוגמה בסיסית לאתחול תהליך מבוזר המיועד לרוץ על גבי מספר GPUs המחוברים ב-NVLink:

import os
import torch
import torch.distributed as dist

def init_distributed_mode():
    if 'RANK' in os.environ and 'WORLD_SIZE' in os.environ:
        rank = int(os.environ["RANK"])
        world_size = int(os.environ['WORLD_SIZE'])
        gpu = int(os.environ['LOCAL_RANK'])
        
        # אתחול תהליך מבוזר באמצעות NCCL המותאם ל-NVLink
        dist.init_process_group(backend='nccl', init_method='env://',
                                world_size=world_size, rank=rank)
        torch.cuda.set_device(gpu)
        print(f"Initialized Rank {rank} on GPU {gpu}")
    else:
        print("Running in single-GPU mode")

if __name__ == '__main__':
    init_distributed_mode()

לקריאה נוספת והעמקה בארכיטקטורה, מומלץ לעיין ב-NVIDIA Blackwell Architecture Technical Brief ובמדריכים הרשמיים של PyTorch Distributed Communication.

הצעד הבא שלכם: כדי לכוון לאימון מבוזר אמיתי, הורידו והריצו את פרויקט הסטארטר הפופולרי DeepSpeed. הגדירו קובץ קונפיגורציה פשוט של ZeRO-Stage 3 והריצו אימון של מודל קטן על גבי מספר GPUs מקומיים או בענן כדי לראות כיצד הזיכרון מתחלק ביניהם בצורה אופטימלית.

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
03

CUDA למפתחי AI

מתי כותבים CUDA kernel ידני, Triton (OpenAI), torch.compile, FlashAttention, vLLM. דוגמאות פרקטיות של hot-path optimization.

~4 שעותמתקדם
שיעור

בעולם ה-AI המודרני, מהירות האימון וההסקה (Inference) היא צוואר הבקבוק המרכזי של המערכת. מפתחי AI ברמת Advanced נדרשים לעיתים קרובות לחרוג מגבולות ה-API הסטנדרטי של PyTorch כדי למקסם את ניצול החומרה (GPU). הבנת שכבת ה-Compute והאצת ה-Hot-path של המודל היא קריטית במיוחד כאשר מריצים מערכות סוכנים מורכבות בזמן אמת, כגון אלו שנבנות באמצעות LangGraph או מערכות הפעלה מבוססות AI המופעלות על ידי Claude.

כדי להשיג ביצועים אלו, אנו משתמשים בספקטרום של כלי אופטימיזציה. בבסיס הפירמידה נמצא torch.compile (החל מגרסה PyTorch 2.0), המנתח את גרף החישוב ומייצר קוד מותאם אוטומטית ללא שינוי בקוד המקור. ברמה הבאה נמצאת Triton של OpenAI, שפה וקומפיילר המאפשרים לכתוב קרנלים (Kernels) יעילים במיוחד ב-Python דמוי-C, מבלי להתמודד עם המורכבות של CUDA C++ ידני. כתיבת CUDA Kernel ידני נשמרת למקרים קיצוניים שבהם נדרשת שליטה אבסולוטית ברמת החומרה והרגיסטר.

דוגמה קלאסית לאופטימיזציה כזו היא FlashAttention, המחשב את מנגנון ה-Attention בצורה חכמה המונעת מעבר מיותר של נתונים בין הזיכרון האיטי (HBM) לזיכרון המהיר (SRAM) של ה-GPU. עבור הגשת מודלים (Serving) בקנה מידה רחב, ספריות כמו vLLM משתמשות ב-PagedAttention כדי לנהל את ה-KV Cache בצורה דינמית ולמנוע פרגמנטציה של הזיכרון, מה שמאפשר הגדלה דרמטית של ה-Throughput.

הנה דוגמה פשוטה לשימוש ב-torch.compile כדי לבצע אופטימיזציה אוטומטית (Fusion) של פונקציית אקטיבציה מותאמת אישית על ה-GPU:

import torch

# הגדרת פונקציה מותאמת אישית
@torch.compile(mode="reduce-overhead")
def custom_gelu(x):
    return x * 0.5 * (1.0 + torch.erf(x / 1.41421))

# הרצה על ה-GPU
x = torch.randn(1024, 1024, device="cuda")
out = custom_gelu(x)

כאשר בונים יישומים מתקדמים, כמו ניטור סוכני קוד בזמן אמת באמצעות Gemini 3.5 Flash, כל מילישנייה של לטנסי קריטית לחוויית המשתמש. שילוב של vLLM להגשת המודל יחד עם אופטימיזציות Triton מותאמות אישית מאפשר לקצר את ה-Time to First Token (TTFT) למינימום האפשרי.

הצעד הבא שלך:

כדי להתחיל ללכלך את הידיים, אנו ממליצים להתקין ולהריץ את אחד מהפרויקטים הבאים:

  1. Triton Tutorials: המדריכים הרשמיים של OpenAI Triton (זמינים ב-GitHub של triton-lang). התחל בכתיבת Vector Addition kernel פשוט ב-Python.
  2. vLLM: התקן את הספרייה והרס שרת מקומי להגשת מודל Llama קטן. השווה את מהירות התגובה (Tokens per second) מול הרצה סטנדרטית ב-Hugging Face Transformers.
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
AI רץ באש
סרה סנדרס, מהנדסת הקונטקסט ב-PostHog, מדברת על ה-Wizard, סוכן CLI אוטומטי שמריץ פקודות על אלפי מכונות מפתחים. היא מספרת על הסיכונים והאתגרים בבניית סוכן כזה ואיך היא בנתה מערכת לגילוי פריצות אבטחה.
02YT AI Engineer · וידאו · מתקדם
סוכנים אמינים: ערימת סוכנים אחראית
גיסל ואן דונגן מציגה את Restate, פלטפורמה לבניית סוכנים אמינים. היא מדגימה סוכן מחקר עמוק החי ב-Slack, המשתמש ביומן אירועים לשיקום תהליכים כושלים. הפלטפורמה שואבת השראה מ-Apache Flink ותשתית אירועים של Meta.
03YT AI Engineer · וידאו · מתקדם
הנדסת רתמה: בניית כלוב הייצור לסוכנים חזקים
מייק צ'יימברס, מפתח ומומחה AI ב-AWS, מסביר על הנדסת רתמה, שהיא בניית כלוב ייצור לסוכנים חזקים. הוא מדגים כיצד לבנות סוכן עם כלים וניהול מידע, ומדגיש את חשיבות הרתמה בפיתוח סוכנים.
04YT IndyDevDan · וידאו · מתקדם
דירוג מהנדסי סוכנים: איך אני מדרג Astra, Fable 5.1 ו-Open-Weights
דירוג מהנדסי סוכנים מושווה את GPT-6 Astra, Claude Fable 5.1 והשדה הפתוח של Open-Weights. הדירוג מבוסס על חמישה בנצ'מרקים: Terminal-Bench v4.0, APEX Agents Leaderboard, AutomationBench, AA-Omniscience ו-DeepSWE v1.1. הדירוג בוחן את הביצועים, העלות והמהירות של כל מודל.
05Latent Space · כתבה · מתקדם
עליית המהנדס המופרס בחזית
מהנדסים מופרסים בחזית הופכים לתפקיד החם ביותר בתעשיית ה-AI. חברות כמו OpenAI ו-Anthropic מגייסות מהנדסים לעבוד ישירות עם לקוחות.
06Pydantic AI · כתבה · מתקדם
עדכון pydantic-ai v2.43.0
עדכון pydantic-ai v2.43.0 כולל תיקוני באגים ותכונות חדשות, כגון הוספת אזהרה בריצה ראשונה. העדכון כולל גם שיפורים ב-OpenAIChatModel.
07Vercel AI SDK · כתבה · מתקדם
עדכון @ai-sdk/tui@1.0.99
עודכן תלותיות ב @ai-sdk/tui לגרסה 1.0.99. העדכון כולל עדכון של תלותיות באי-סדק.
08LangChain releases · כתבה · מתקדם
langchain-core==1.6.3
langchain-core==1.6.3: הוספת תכונת עקיבה של שם המודל וספקי המדענות