יום שישי, 31 ביולי 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים NVIDIA — לב החומרה של ה-AI
מסלול לימוד

NVIDIA — לב החומרה של ה-AI

CUDA, H100/B100/B200/Blackwell, NVLink, DGX Cloud, Run:ai (acquired). למה NVIDIA שווה $4T ולמה זה אולי לא יחזיק לנצח. גם CUDA basics למפתח.

6 שעות
3 צמתים
בינוני
01

NVIDIA — מ-GPU לגיימרים לחברה הכי שווה בעולם

הסיפור מ-1993 (Jensen Huang + 2), GeForce, CUDA (2006), Tegra, מהפכת ה-AI 2012 עם AlexNet, מ-$100B ל-$4T תוך 5 שנים.

~2 שעותמתחילים
שיעור

סיפורה של חברת NVIDIA הוא אחד המרתקים ביותר בהיסטוריה של הטכנולוגיה. החברה, שהוקמה בשנת 1993 על ידי Jensen Huang ושני שותפיו, החלה את דרכה במטרה לפתור בעיה אחת מוגדרת: הבאת גרפיקה תלת-ממדית למשחקי מחשב. פריצת הדרך הראשונה שלהם הייתה מותג ה-GeForce, שהציג לעולם את המושג GPU (Graphics Processing Unit) - מעבד ייעודי לחישובים מקביליים מורכבים הדרושים לרינדור גרפיקה בזמן אמת.

התפנית הגדולה שהפכה את NVIDIA לענקית שהיא היום התרחשה בשנת 2006 עם השקת ארכיטקטורת CUDA. Jensen Huang הבין שהיכולת של ה-GPU לבצע מיליוני חישובים פשוטים במקביל (בניגוד ל-CPU שמבצע חישובים סדרתיים מורכבים) יכולה לשמש להרבה יותר מאשר רק משחקי מחשב. CUDA אפשרה למדענים ולמפתחי תוכנה לכתוב קוד ישירות ל-GPU בשפות תכנות סטנדרטיות כמו C ו-C++, ובכך פתחה את השער למחשוב על (Supercomputing) נגיש.

בשנת 2012, עולם הבינה המלאכותית השתנה לתמיד בזכות רשת הנוירונים AlexNet. חוקרים גילו שאימון רשתות נוירונים עמוקות (Deep Learning) על גבי כרטיסי המסך של NVIDIA מהיר פי עשרות מונים מאשר על מעבדים רגילים. זו הייתה נקודת המפנה שבה NVIDIA הפכה רשמית למנוע שמאחורי מהפכת ה-AI. מאז, החברה התמקדה בפיתוח שבבים ייעודיים ל-AI, כמו סדרת ה-H100 וה-Blackwell החדשה, מה שהזניק את שווי השוק שלה מ-100 מיליארד דולר לכ-4 טריליון דולר תוך פחות מחמש שנים.

כדי להתחיל לעבוד עם הכלים של NVIDIA בעולם ה-AI, אין צורך לרכוש חומרת קצה יקרה מיד בהתחלה. ספריות פופולריות כמו PyTorch ו-TensorFlow מגיעות עם תמיכה מובנית ב-CUDA. מפתחים מתחילים יכולים להשתמש בפלטפורמות ענן חינמיות כמו Google Colab, המציעות גישה חופשית ל-GPUs של NVIDIA, כדי להריץ ולאמן מודלים של למידה עמוקה בקלות ובמהירות.

הנה דוגמה קצרה בפייתון המציגה כיצד לבדוק האם ספריית PyTorch מזהה את ה-GPU של NVIDIA (באמצעות CUDA) ומעבירה חישוב פשוט אליו:

import torch

# בדיקה האם CUDA זמין במערכת
cuda_available = torch.cuda.is_available()
print(f"Is CUDA available? {cuda_available}")

if cuda_available:
    # קבלת שם כרטיס המסך
    device_name = torch.cuda.get_device_name(0)
    print(f"Using GPU: {device_name}")
    
    # יצירת טנזור והעברתו ל-GPU לביצוע חישוב מהיר
    x = torch.tensor([1.0, 2.0, 3.0]).to("cuda")
    print("Tensor on GPU:", x)

לקריאה נוספת והעמקה, מומלץ לבקר ב-NVIDIA CUDA Programming Guide הרשמי כדי להבין את הארכיטקטורה לעומק, או לקרוא על פרויקט AlexNet on ImageNet שהתחיל את מהפכת הלמידה העמוקה.

הצעד הבא שלכם: פתחו מחברת Google Colab חדשה, שנו את סביבת ההרצה (Runtime) ל-GPU, והריצו את קוד הבדיקה שלמעלה. לאחר מכן, נסו להוריד מודל סיווג תמונות פשוט מ-Hugging Face ולהריץ אותו על ה-GPU כדי לראות את מהירות הביצוע בפועל!

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
02

משפחת H100/B100/B200/Blackwell ו-NVLink

ארכיטקטורת Hopper מול Blackwell, מה זה NVLink 5, GB200 NVL72, DGX SuperPOD. השוואה ל-Cerebras, Groq, TPU. למה כולם תקועים על NVIDIA.

~3 שעותמתקדם
שיעור

בעולם ה-AI המודרני, כוח עיבוד הוא צוואר הבקבוק המרכזי. המעבר מארכיטקטורת Hopper (סדרת H100) לארכיטקטורת Blackwell החדשה (B100, B200) מסמן קפיצת מדרגה דרמטית. בעוד ש-Hopper הציגה ביצועי שיא ביישומי LLM בזכות Tensor Cores מדור רביעי, Blackwell לוקחת את זה לקצה עם תמיכה בפורמט FP4 (דיוק של 4-ביט) ומנוע Transformer Engine דור שני. השיפור אינו רק בליבה הבודדת, אלא ביכולת לחבר מאות ואלפי שבבים יחד כדי שיפעלו כיחידת מחשוב אחת אינטגרלית.

כאן נכנס לתמונה NVLink 5, הדור החמישי של טכנולוגיית הקישוריות של NVIDIA. NVLink 5 מספק רוחב פס דו-כיווני חסר תקדים של 1.8 TB/s לכל GPU, פי 2 מהדור הקודם. פריצת הדרך האמיתית מתבטאת במערכת GB200 NVL72 – ארון שרתים (Rack) שלם המאחד 36 מעבדי Grace CPU ו-72 מעבדי Blackwell GPU. באמצעות NVLink Switch System, המערכת הזו מתנהגת כ-GPU ענק יחיד עם זיכרון משותף (Unified Memory) בנפח של 13.5TB. עבור מודלים בעלי טריליוני פרמטרים, זוהי הדרך היחידה לבצע אימון ואינפרנס ללא צווארי בקבוק של תקשורת רשת סטנדרטית.

כאשר נדרש כוח מחשוב בקנה מידה של מחשב-על, NVIDIA מציעה את ה-DGX SuperPOD. זוהי ארכיטקטורת אשכולות (Clusters) המשלבת מספר מסדי GB200 NVL72 יחד עם קישוריות InfiniBand מהירה ומתגי Quantum-X800. ה-SuperPOD מאפשר לחבר אלפי מעבדים יחד תוך שמירה על יעילות תקשורת גבוהה במיוחד, מה שמקצר את זמני האימון של מודלי הענק משבועות לימים בודדים.

למרות הדומיננטיות של NVIDIA, השוק מציע אלטרנטיבות מעניינות. Cerebras מציגה את גישת ה-Wafer-Scale Engine (WSE-3), שבב ענק יחיד בגודל של פרוסת סיליקון שלמה, המונע לחלוטין את הצורך בתקשורת בין שבבים נפרדים. Groq מציעה ארכיטקטורת LPU (Language Processing Unit) המבוססת על זיכרון SRAM מהיר במיוחד ועיבוד דטרמיניסטי, המצטיין במהירות אינפרנס פנומנלית ל-LLMs. מנגד, ה-TPU (Tensor Processing Unit) של Google מהווה אלטרנטיבה חזקה וזולה יחסית בענן של גוגל. עם זאת, המתחרים הללו סובלים מחסרון מרכזי: הם דורשים התאמות קוד מורכבות ואינם נהנים מהאקוסיסטם הרחב של NVIDIA.

הסיבה שכולם "תקועים" על NVIDIA אינה רק החומרה, אלא בעיקר ה-Moat (החפיר העסקי והטכנולוגי) שנקרא CUDA. פלטפורמת התוכנה של NVIDIA, יחד עם ספריות אופטימיזציה כמו NCCL לתקשורת מבוזרת, הפכה לסטנדרט דה-פקטו בתעשייה. כמעט כל ספריית AI מודרנית (כמו PyTorch או TensorFlow) נכתבת ועוברת אופטימיזציה קודם כל עבור חומרת NVIDIA. המעבר לחומרה מתחרה דורש לעיתים קרובות שכתוב של שכבות תשתית שלמות, סיכון שרוב החברות אינן מוכנות לקחת.

כדי להתחיל לעבוד עם סביבות מבוזרות המנצלות את הקישוריות המהירה של NVIDIA, אנו משתמשים ב-PyTorch Distributed ובספריית NCCL. להלן דוגמה בסיסית לאתחול תהליך מבוזר המיועד לרוץ על גבי מספר GPUs המחוברים ב-NVLink:

import os
import torch
import torch.distributed as dist

def init_distributed_mode():
    if 'RANK' in os.environ and 'WORLD_SIZE' in os.environ:
        rank = int(os.environ["RANK"])
        world_size = int(os.environ['WORLD_SIZE'])
        gpu = int(os.environ['LOCAL_RANK'])
        
        # אתחול תהליך מבוזר באמצעות NCCL המותאם ל-NVLink
        dist.init_process_group(backend='nccl', init_method='env://',
                                world_size=world_size, rank=rank)
        torch.cuda.set_device(gpu)
        print(f"Initialized Rank {rank} on GPU {gpu}")
    else:
        print("Running in single-GPU mode")

if __name__ == '__main__':
    init_distributed_mode()

לקריאה נוספת והעמקה בארכיטקטורה, מומלץ לעיין ב-NVIDIA Blackwell Architecture Technical Brief ובמדריכים הרשמיים של PyTorch Distributed Communication.

הצעד הבא שלכם: כדי לכוון לאימון מבוזר אמיתי, הורידו והריצו את פרויקט הסטארטר הפופולרי DeepSpeed. הגדירו קובץ קונפיגורציה פשוט של ZeRO-Stage 3 והריצו אימון של מודל קטן על גבי מספר GPUs מקומיים או בענן כדי לראות כיצד הזיכרון מתחלק ביניהם בצורה אופטימלית.

עדיין אין פריטים שתאמו את הנושא הזה. כשמתויגים פריטים חדשים — הם יופיעו כאן אוטומטית.
03

CUDA למפתחי AI

מתי כותבים CUDA kernel ידני, Triton (OpenAI), torch.compile, FlashAttention, vLLM. דוגמאות פרקטיות של hot-path optimization.

~4 שעותמתקדם
שיעור

בעולם ה-AI המודרני, מהירות האימון וההסקה (Inference) היא צוואר הבקבוק המרכזי של המערכת. מפתחי AI ברמת Advanced נדרשים לעיתים קרובות לחרוג מגבולות ה-API הסטנדרטי של PyTorch כדי למקסם את ניצול החומרה (GPU). הבנת שכבת ה-Compute והאצת ה-Hot-path של המודל היא קריטית במיוחד כאשר מריצים מערכות סוכנים מורכבות בזמן אמת, כגון אלו שנבנות באמצעות LangGraph או מערכות הפעלה מבוססות AI המופעלות על ידי Claude.

כדי להשיג ביצועים אלו, אנו משתמשים בספקטרום של כלי אופטימיזציה. בבסיס הפירמידה נמצא torch.compile (החל מגרסה PyTorch 2.0), המנתח את גרף החישוב ומייצר קוד מותאם אוטומטית ללא שינוי בקוד המקור. ברמה הבאה נמצאת Triton של OpenAI, שפה וקומפיילר המאפשרים לכתוב קרנלים (Kernels) יעילים במיוחד ב-Python דמוי-C, מבלי להתמודד עם המורכבות של CUDA C++ ידני. כתיבת CUDA Kernel ידני נשמרת למקרים קיצוניים שבהם נדרשת שליטה אבסולוטית ברמת החומרה והרגיסטר.

דוגמה קלאסית לאופטימיזציה כזו היא FlashAttention, המחשב את מנגנון ה-Attention בצורה חכמה המונעת מעבר מיותר של נתונים בין הזיכרון האיטי (HBM) לזיכרון המהיר (SRAM) של ה-GPU. עבור הגשת מודלים (Serving) בקנה מידה רחב, ספריות כמו vLLM משתמשות ב-PagedAttention כדי לנהל את ה-KV Cache בצורה דינמית ולמנוע פרגמנטציה של הזיכרון, מה שמאפשר הגדלה דרמטית של ה-Throughput.

הנה דוגמה פשוטה לשימוש ב-torch.compile כדי לבצע אופטימיזציה אוטומטית (Fusion) של פונקציית אקטיבציה מותאמת אישית על ה-GPU:

import torch

# הגדרת פונקציה מותאמת אישית
@torch.compile(mode="reduce-overhead")
def custom_gelu(x):
    return x * 0.5 * (1.0 + torch.erf(x / 1.41421))

# הרצה על ה-GPU
x = torch.randn(1024, 1024, device="cuda")
out = custom_gelu(x)

כאשר בונים יישומים מתקדמים, כמו ניטור סוכני קוד בזמן אמת באמצעות Gemini 3.5 Flash, כל מילישנייה של לטנסי קריטית לחוויית המשתמש. שילוב של vLLM להגשת המודל יחד עם אופטימיזציות Triton מותאמות אישית מאפשר לקצר את ה-Time to First Token (TTFT) למינימום האפשרי.

הצעד הבא שלך:

כדי להתחיל ללכלך את הידיים, אנו ממליצים להתקין ולהריץ את אחד מהפרויקטים הבאים:

  1. Triton Tutorials: המדריכים הרשמיים של OpenAI Triton (זמינים ב-GitHub של triton-lang). התחל בכתיבת Vector Addition kernel פשוט ב-Python.
  2. vLLM: התקן את הספרייה והרס שרת מקומי להגשת מודל Llama קטן. השווה את מהירות התגובה (Tokens per second) מול הרצה סטנדרטית ב-Hugging Face Transformers.
חומרי קריאה8 פריטים
01Pydantic AI · כתבה · מתקדם
pydantic-ai v2.21.0
שוחררה גרסה v2.21.0 של pydantic-ai. הגרסה החדשה כוללת תכונות חדשות ותיקוני באגים, כולל הוספת per_request_input_tokens_limit ל-UsageLimits ורענון KnownModelName מ-Gateway probes ו-Google image IDs.
02YT AI Engineer · וידאו · מתקדם
Kepler בונה AI איכותי לשירותים פיננסיים
Vinoo Ganesh, מנכ"ל Kepler, מסביר כיצד החברה בנתה AI איכותי לשירותים פיננסיים. המודל משמש רק חלק מהמערכת, ומוקף בסביבה דטרמיניסטית שמאפשרת עקיבה אחר מקור כל מספר.
03Vercel AI SDK · כתבה · בינוני
@ai-sdk/workflow עדכון
חברת Vercel עדכנה את ה-SDK שלה. העדכון כולל עדכונים לתלויות ושיפורים אחרים.
04OpenAI Agents (js) · כתבה · מתקדם
עדכון v0.14.1
עדכון v0.14.1 של OpenAI Agents כולל תיקונים ושיפורים. תיקון הליך חיי מחזור וכלי עזר לסוכנים. תמיכה בנתיבים מקומיים ב-Windows.
05OpenAI Agents (py) · כתבה · מתקדם
עדכון v0.19.1
עדכון v0.19.1 של OpenAI Agents כולל תמיכה בנתיבי אירוח יטיבים ותיקונים לבעיות שונות. העדכון כולל גם שיפורים באבטחת המידע.
06YT AI Engineer · וידאו · מתקדם
אינטגרציה של סוכנים AI במערכות Event-Sourced
Divakar Kumar מציג גישה להוספת שכבת סוכנים AI למערכות קיימות. הסוכנים עובדים על אירועים ומחליטים במקרים אמביגויים. הגישה משתמשת בארכיטקטורת event-sourced קיימת, ומוסיפה שכבה סמנטית וסוכנים המתקשרים באופן א-סינכרוני.
07YT AI Engineer · וידאו · מתקדם
כלים AI להנדסה מופרסת קדימה — Vasuman Moza, Varick Agents
Varick Agents מפתחים כלים AI להנדסה מופרסת קדימה, המאפשרים אוטומציה של תהליכים בתוך ארגונים. הכלים משתמשים במודלים כמו Claude ו-Codex, ומאפשרים למהנדסים ליצור תהליכים אוטומטיים באמצעות כלים כמו Postgres.
08YT AI Engineer · וידאו · מתקדם
הנדסת פריסה קדמית ב-Cognition
חברת Cognition מודדת את התוצאות הנראות ללקוחות, לא רק את השימוש בטוקנים. הם מדווחים על רדוקציה של 82% בעבודה. ההנדסה המופרסת מתמקדת במוצרים ובפתרונות שמשפיעים על הלקוחות.