יום חמישי, 30 ביולי 2026 LIVE
AI־INFO
ידיעון ה־AI של ישראל·מסלול לימוד

בית מסלולים Gemini / Vertex
מסלול לימוד

Gemini / Vertex

עבודה עם משפחת Gemini, long context, multimodal, Vertex AI.

12 שעות
4 צמתים
בינוני
01

Gemini API

aistudio.google.com, generateContent, מהקצה.

~3 שעותבינוני
שיעור

ממשק התכנות של Gemini (ה-Gemini API) מאפשר למפתחים לרתום את עוצמת מודלי השפה והמולטי-מודאל המתקדמים של Google ישירות לתוך האפליקציות שלהם. הלב של העבודה עם ה-API מתחיל בפלטפורמת Google AI Studio (בכתובת aistudio.google.com), סביבת פיתוח מבוססת אינטרנט המאפשרת להתנסות עם פרומפטים, לבחור מודלים, להגדיר פרמטרים ולקבל מפתח API (API Key) בחינם ובמהירות כדי להתחיל לפתח "מהקצה" (from scratch).

השימוש ב-Gemini API מציע יתרונות ייחודיים, ובראשם חלון הקשר (Context Window) העצום של מודלי Gemini 1.5 Pro ו-Gemini 1.5 Flash, המאפשר לעבד מיליוני טוקנים של טקסט, קוד, אודיו ווידאו במכה אחת. מפתחים בוחרים ב-Gemini כאשר הם זקוקים ליכולות מולטי-מודאליות מובנות ללא צורך במודלים נפרדים לראייה ממוחשבת או לעיבוד שמע, וכן בזכות מהירות התגובה הגבוהה והעלויות האטרקטיביות של מודלי ה-Flash.

כדי להתחיל, נרשמים ל-Google AI Studio, מפיקים מפתח API, ומתקינים את ספריית ה-SDK הרשמית של Google ב-Python. פונקציית הליבה שבה נשתמש לרוב היא generateContent (או generate_content ב-Python SDK), המאפשרת לשלוח בקשות טקסטואליות או מולטי-מודאליות ולקבל תגובה מהירה מהמודל.

הנה דוגמה מינימלית להפעלת המודל ב-Python:

import google.generativeai as genai
import os

# הגדרת מפתח ה-API
genai.configure(api_key=os.environ["GEMINI_API_KEY"])

# יצירת מופע של המודל
model = genai.GenerativeModel('gemini-1.5-flash')

# יצירת תוכן
response = model.generate_content("הסבר בקצרה מהו כוח הכבידה.")
print(response.text)

כאשר בונים מערכות מורכבות מבוססות LLM, חשוב להבין את האתגרים המדעיים הנלווים לכך. לדוגמה, מחקרים בתחום מראים כיצד ניתן לשפר את אמינות המודלים: מאמרים כמו שיפור עקביות תיוג באמצעות הגדרות חוקתיות מפורטות והערכה מבוססת AI מציעים שיטות להבטחת פלט עקבי, בעוד שמחקרים על הפחתת הזיות ב-LVLM באמצעות ניתוק אורתוגונלי יריב מתמודדים עם בעיית ההזיות במודלים מולטי-מודאליים הדומים ל-Gemini.

הצעד הבא שלכם: כדי לצלול לעבודה מעשית במהירות, אנו ממליצים להוריד ולהריץ את פרויקט הסטארטר Gemini Quickstart. פרויקט זה מכיל פחות מ-50 שורות קוד ויאפשר לכם להריץ שאילתה ראשונה בתוך פחות מ-5 דקות. לאחר מכן, תוכלו להעמיק בדוגמאות מורכבות יותר של מולטי-מודאליות וקריאת פונקציות (Function Calling) דרך ה-Google Gemini Cookbook.

פרויקטי התחלה2 REPOS
Google Gemini Cookbook
★ 14k
python מתחילים
הקוקבוק הרשמי של Gemini. דוגמאות multi-modal, function calling, long context.
git clone https://github.com/google-gemini/cookbook && pip install google-genai
GitHub ↗
Gemini Quickstart
★ 1.2k
python מתחילים
מינימום מינימלי להתחיל עם Gemini ב-Python. 50 שורות, רץ ב-5 דקות.
pip install google-genai
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
DeepSWE: בנצ'מרק לקידוד עמיד בזיהום
DeepSWE הוא בנצ'מרק לקידוד עמיד בזיהום, הכולל 113 משימות קידוד שנכתבו מאפס. הבנצ'מרק מודד את היכולת של מודלים כמו GPT ו-Claude לבצע משימות קידוד מורכבות.
02YT AI Engineer · וידאו · מתקדם
מדוע קטנים? מודלים זעירים וסוכנים ב-Edge/רובוטיקה
צוות Google AI Edge מפתח מודלים קטנים מספיק כדי לרוץ על מכשירים בקצה. מודל Gemma עם 2 מיליארד פרמטרים, מקוטע ל-2.9 ביטים למשקל, רץ על Raspberry Pi. הם גם משתמשים במודלים זעירים, מ-500 מיליון פרמטרים ומטה, שמגיעים למחשבים ישנים ומכשירים זולים.
03YT AI Engineer · וידאו · מתקדם
Vending-Bench: הערכת אג'נטים לטווח ארוך
Vending-Bench הוא פלטפורמה להערכת ביצועים של אג'נטים לטווח ארוך. היא מאפשרת למודלים כמו Gemini, GPT ו-Claude לנהל עסקים מדומים ולהפגין התנהגות מורכבת.
04YT AI Engineer · וידאו · מתקדם
HTML הכל מה שסוכנים צריכים
סוכנים מלמדים לכתוב קוד וידאו באמצעות HTML. החברה HeyGen פיתחה שיטה ליצירת וידאו באמצעות מודלים קטנים ו HTML. הדבר מאפשר יצירת וידאו מתוחכם עם תוצאות דטרמיניסטיות.
05MarkTechPost · כתבה · מתקדם
גוגל משחררת Gemini 3.6 Flash
גוגל השחררה שלושה מודלים חדשים של Gemini: 3.6 Flash, 3.5 Flash-Lite ו-3.5 Flash Cyber. מודלים אלו מיועדים לעבודות אגנטיות ומספקים יעילות גבוהה יותר ופחות עלות. Gemini 3.6 Flash הוא המודל החדש שמספק איכות טובה יותר ומחיר נמוך יותר.
06Pydantic AI · כתבה · בינוני
עדכון v2.14.0: תכונות ותיקונים
עדכון v2.14.0 כולל תכונות חדשות כגון תמיכה ב-reasoning_effort ותיקונים למודלים מיושנים. העדכון כולל גם הסרת מודלים ישנים של Gemini.
07YT AI Engineer · וידאו · מתקדם
מחקר למציאות: Benoit Schillings, Google DeepMind, סגן נשיא מחקר
בנואה שילינגס, סגן נשיא מחקר ב-Google DeepMind, דן בהשפעה המהפכנית של AI יוצרת על הנדסת תוכנה. הוא מציג את הפרויקט Pitchfork ואת העתיד של מודלים וארכיטקטורה.
08Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
02

Long context (1M+)

איך לעבוד עם חלון 1-2M tokens — RAG-less workflows.

~3 שעותבינוני
שיעור

עד לא מזמן, העבודה עם מודלי שפה גדולים (LLMs) דרשה מאיתנו "לקצץ" מידע או להסתמך על מערכות RAG (Retrieval-Augmented Generation) מורכבות כדי להזין למודל את המידע הרלוונטי ביותר מתוך מאגר גדול. כיום, עם כניסתם של מודלים התומכים בחלונות הקשר עצומים של 1-2 מיליון טוקנים (כמו Gemini 1.5 Pro), נפתח פתח לשיטת עבודה חדשה: RAG-less workflows. בגישה זו, במקום לבנות אינדקסים, וקטורים ומנגנוני שליפה, אנו פשוט מזינים את כל בסיס הקוד, ספריית המסמכים המלאה, או שעות של וידאו ישירות לתוך ה-Context Window של המודל.

היתרון הגדול ביותר של עבודה עם Long Context הוא היכולת של המודל להבין קשרים גלובליים מורכבים ואינטגרטיביים לאורך כל החומר, דבר שמערכות RAG מתקשות לעשות בשל אופי השליפה המקומי שלהן. לדוגמה, ניתוח עקביות של דמויות לאורך ספר שלם, או איתור באגים ארכיטקטוניים המושפעים מעשרות קבצי קוד שונים. עם זאת, שימוש ב-Long Context דורש הבנה של עלויות (התמחור מבוסס על כמות הטוקנים) וזמני תגובה (Latency), ולכן חשוב להבין מתי נכון להשתמש בו ומתי לשלב שיטות משלימות כמו הגדרת חוקים מובנית לשיפור הביצועים.

כדי לעבוד נכון עם חלון הקשר ענק, עלינו להכיר טכניקות פרומפטינג מתקדמות. בניגוד לפרומפט קצר, ב-Long Context יש חשיבות מכרעת למיקום המידע ולמבנה ההנחיות. מומלץ להשתמש במפרידים ברורים (כמו תגיות XML) כדי להפריד בין חומרי המקור לבין ההנחיות עצמן, ולספק למודל "הוראות חוקתיות" ברורות שיעזרו לו לנווט בתוך הררי המידע ללא הזיות.

בואו נראה דוגמה פשוטה באמצעות ה-SDK של Gemini להעלאת קובץ קוד שלם וביצוע שאילתה עליו ללא צורך ב-RAG:

import google.generativeai as genai

genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel('gemini-1.5-pro')

with open("large_codebase.txt", "r") as f:
    codebase_content = f.read()

prompt = f"""
You are an expert code auditor. Analyze the following codebase and identify any security vulnerabilities.

<codebase>
{codebase_content}
</codebase>
"""

response = model.generate_content(prompt)
print(response.text)

מחקרים אחרונים מראים כי ככל שחלון ההקשר גדל, עלינו למצוא דרכים חדשות להבטיח את עקביות הפלט ולמנוע הזיות. לדוגמה, המחקר על שיפור עקביות תיוג באמצעות הגדרות חוקתיות מפורטות והערכה מבוססת AI מציע שימוש בחוקים נוקשים ומובנים כדי לשמור על דיוק המודל במשימות מורכבות. בנוסף, הבנת האופן שבו מודלים מעבדים מידע רב-ממדי והקשרים רחבים באה לידי ביטוי גם במחקרים העוסקים ב-המרות מצב עולם לסיפור תקשורתי נוירו-סימבולי, המדגישים את החשיבות של מעקב אחר שינויי מצב לאורך זמן בהקשרים ארוכים.

הצעד הבא שלכם: כדי להתנסות בעבודה מעשית עם מיליוני טוקנים, מומלץ להוריד ולהריץ את הדוגמאות הרשמיות מתוך ה-Long Context Examples ב-Gemini Cookbook. התחילו עם מדריך ה-codebase analysis או ה-video understanding, המדגימים כיצד להעלות סרטון באורך מלא או פרויקט קוד שלם ולשאול עליהם שאלות מורכבות תוך שניות ספורות.

פרויקטי התחלה1 REPOS
Long Context Examples
★ 14k
python בינוני
תיקיית long_context בקוקבוק — איך לעבוד עם 1M+ tokens, video understanding, full codebase analysis.
cd cookbook/quickstarts
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
DeepSWE: בנצ'מרק לקידוד עמיד בזיהום
DeepSWE הוא בנצ'מרק לקידוד עמיד בזיהום, הכולל 113 משימות קידוד שנכתבו מאפס. הבנצ'מרק מודד את היכולת של מודלים כמו GPT ו-Claude לבצע משימות קידוד מורכבות.
02YT AI Engineer · וידאו · מתקדם
מדוע קטנים? מודלים זעירים וסוכנים ב-Edge/רובוטיקה
צוות Google AI Edge מפתח מודלים קטנים מספיק כדי לרוץ על מכשירים בקצה. מודל Gemma עם 2 מיליארד פרמטרים, מקוטע ל-2.9 ביטים למשקל, רץ על Raspberry Pi. הם גם משתמשים במודלים זעירים, מ-500 מיליון פרמטרים ומטה, שמגיעים למחשבים ישנים ומכשירים זולים.
03YT AI Engineer · וידאו · מתקדם
Vending-Bench: הערכת אג'נטים לטווח ארוך
Vending-Bench הוא פלטפורמה להערכת ביצועים של אג'נטים לטווח ארוך. היא מאפשרת למודלים כמו Gemini, GPT ו-Claude לנהל עסקים מדומים ולהפגין התנהגות מורכבת.
04YT AI Engineer · וידאו · מתקדם
HTML הכל מה שסוכנים צריכים
סוכנים מלמדים לכתוב קוד וידאו באמצעות HTML. החברה HeyGen פיתחה שיטה ליצירת וידאו באמצעות מודלים קטנים ו HTML. הדבר מאפשר יצירת וידאו מתוחכם עם תוצאות דטרמיניסטיות.
05MarkTechPost · כתבה · מתקדם
גוגל משחררת Gemini 3.6 Flash
גוגל השחררה שלושה מודלים חדשים של Gemini: 3.6 Flash, 3.5 Flash-Lite ו-3.5 Flash Cyber. מודלים אלו מיועדים לעבודות אגנטיות ומספקים יעילות גבוהה יותר ופחות עלות. Gemini 3.6 Flash הוא המודל החדש שמספק איכות טובה יותר ומחיר נמוך יותר.
06Pydantic AI · כתבה · בינוני
עדכון v2.14.0: תכונות ותיקונים
עדכון v2.14.0 כולל תכונות חדשות כגון תמיכה ב-reasoning_effort ותיקונים למודלים מיושנים. העדכון כולל גם הסרת מודלים ישנים של Gemini.
07YT AI Engineer · וידאו · מתקדם
מחקר למציאות: Benoit Schillings, Google DeepMind, סגן נשיא מחקר
בנואה שילינגס, סגן נשיא מחקר ב-Google DeepMind, דן בהשפעה המהפכנית של AI יוצרת על הנדסת תוכנה. הוא מציג את הפרויקט Pitchfork ואת העתיד של מודלים וארכיטקטורה.
08Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.
03

Multimodal

תמונות, וידאו, אודיו ב-Gemini — דוגמאות שימוש.

~3 שעותבינוני
שיעור

בעולם ה-AI המודרני, מודלים כבר אינם מוגבלים לטקסט בלבד. מודלים מולטי-מודליים (Multimodal), ובראשם משפחת מודלי Gemini של Google, מסוגלים לעבד ולהבין סוגי מדיה שונים - טקסט, תמונות, אודיו ווידאו - בו-זמנית ובצורה אחודה. המשמעות היא שהמודל לא רק "רואה" תמונה או "שומע" קובץ קול כקלט נפרד שעובר המרה לטקסט, אלא מנתח את המידע הגולמי ישירות, מה שמאפשר הבנה עמוקה והקשרית הרבה יותר של העולם האמיתי.

הצורך בפתרונות מולטי-מודליים עולה כאשר אנו נדרשים לפתור בעיות מורכבות שאינן ניתנות לתיאור טקסטואלי פשוט. לדוגמה, ניתוח סרטוני אבטחה בזמן אמת, זיהוי פגמים בקו ייצור מתוך תמונות, או יצירת עוזרים קוליים אינטראקטיביים שמגיבים לטון הדיבור של המשתמש. שילוב היכולות הללו מאפשר להגביר את היצירתיות האנושית והפרודוקטיביות, כפי שמתואר במאמר של MIT Tech Review AI על הרחבת היצירתיות בעידן ה-AI. בנוסף, ספריות פופולריות כמו LlamaIndex משלבות תמיכה מובנית במודלים מולטי-מודליים כדי לאפשר בניית מערכות RAG (Retrieval-Augmented Generation) מתקדמות המשלבות מסמכים עם תרשימים ותמונות.

כדי להתחיל לעבוד עם יכולות המולטי-מודל של Gemini, אנו משתמשים ב-SDK הרשמי של Google. המודל מקבל כקלט רשימה (List) המכילה שילוב של מחרוזות טקסט ואובייקטים של מדיה (כמו תמונות או קבצי אודיו). הנה דוגמה קלאסית לניתוח תמונה והפקת תובנות ממנה בעזרת קוד Python פשוט:

import google.generativeai as genai
from PIL import Image

genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel('gemini-1.5-flash')

# טעינת תמונה מקומית
img = Image.open('chart.png')

# שליחת התמונה יחד עם הנחיית טקסט
response = model.generate_content([
    "נתח את הגרף שבתמונה והסבר מהן המגמות העיקריות המוצגות בו.",
    img
])
print(response.text)

מעבר לניתוח תמונות סטטיות, Gemini מצטיין בטיפול בוידאו ואודיו ארוכים בזכות חלון הקשר (Context Window) העצום שלו. ניתן להזין סרטון של שעה שלמה ולשאול שאלות מורכבות על אירועים ספציפיים שהתרחשו בו, או להשתמש ב-APIs ייעודיים לעבודה בזמן אמת. פרויקטים מודרניים משתמשים בחיבורי WebSocket כדי להזרים אודיו ווידאו דו-כיווניים, מה שמאפשר חוויית שיחה אנושית כמעט ללא שיהוי (Latency).

הצעד הבא שלך: כדי לחוות את העוצמה של מולטי-מודליות בזמן אמת, אנו ממליצים להוריד ולהריץ את הפרויקט Gemini Multimodal Live API. זהו ממשק קצה מבוסס Web המאפשר לך להתחבר ל-API של Gemini באמצעות WebSocket ולנהל שיחה קולית וחזותית חיה בזמן אמת. התקן את הפרויקט מקומית, הזן את מפתח ה-API שלך, והתחל להתנסות בעתיד של ממשקי האדם-מכונה.

פרויקטי התחלה1 REPOS
Gemini Multimodal Live API
★ 3k
typescript מתקדם
WebSocket-based real-time multimodal — אודיו + וידאו + טקסט בו-זמנית.
git clone https://github.com/google-gemini/live-api-web-console && npm install
GitHub ↗
חומרי קריאה8 פריטים
01MIT Tech Review AI · כתבה · מתקדם
הדרך לעל-אינטליגנציה מלאכותית
מערכת בריאות המורכבת מסוכנים רבים, כל אחד מומחה בתחומו. הם יכולים להחליף נתונים, אך עדיין לא מסוגלים לתאם טיפול רפואי ללא החלטות אנושיות. תוספת שכבה סמנטית, 'אינטרנט של קוגניציה', מאפשרת לסוכנים לעבוד ול'חשוב' יחד.
02YT AI Engineer · וידאו · מתקדם
מציאות מסובכת של קנה מידה: נתונים סינתטיים ופרה-אימון
חברת poolside מפתחת נתונים סינתטיים ופרה-אימון לקודים אגנטיים. החברה משתמשת בצינור מרובשבבות ליצירת נתונים סינתטיים, ומאמנת מודלים עם 118 מיליארד פרמטרים. התוצאות הראשוניות מראות עליונות על מודל GLM 4.5 Air.
03YT AI Engineer · וידאו · מתקדם
בניית אימון סגור לסוכנות רב-מודאלית בקנה מידה
חברת Uber פיתחה שיטה לבניית אימון סגור עבור סוכנות רב-מודאלית. המערכת משפרת צילומי מזון עבור סוחרים עצמאיים באמצעות שילוב אותונומי וידאו. החידוש כולל שיטות למניעת הונאה ובניית משוב סגור.
04YT AI Engineer · וידאו · מתקדם
סוכנים רב-עכבר: פריצת דרך בשימוש במחשב
צוות פיתח כלי בשם Cua Driver, המאפשר לסוכנים רבים לפעול על מחשב בו-זמנית. הכלי משתמש ב-APIs של המערכת ההפעלה כדי לאפשר לסוכנים לפעול על חלונות רקע. נבדקו 130 משימות שונות על 5 פלטפורמות.
05MarkTechPost · כתבה · מתקדם
בניית מערכת VideoAgent-Style: פירוש כוונה, תכנון גרף וניתוב כלים
מערכת VideoAgent-Style מאפשרת עריכת וידאו באמצעות פקודות בשפה טבעית. המערכת משתמשת בפירוש כוונה, תכנון גרף וניתוב כלים כדי ליצור תוצרים וידאו מותאמים. המערכת כוללת כלים כמו FFmpeg, Whisper ו-PIL.
06MarkTechPost · כתבה · מתקדם
מעבדות Thinking Machines מציגות תיקון טכני לבניית AI מרוכזת אדם
חוקרים במעבדות Thinking Machines פרסמו דו״ח המציע בניית AI המותאמת לצורכי בני אדם. הדו״ח טוען כי רוב ה-AI הנמצא בשימוש היום מאומן במקומות ספורים ואז ננעל. החוקרים רוצים AI שהוא מבוזר, מותאם אישית ומעוצב על ידי משתמשיו.
07MarkTechPost · כתבה · מתקדם
מדריך NVIDIA ל-Cosmos-Framework: יישום מיניאטורי של Cosmos 3
NVIDIA השיקה מדריך ל-Cosmos-Framework, המראה כיצד ליישם מודל עולם מיניאטורי עם Omnimodal Mixture-of-Transformers. המדריך מתמקד בחומרה של Colab ובאיך להתגבר על מגבלות החומרה.
08YT IndyDevDan · וידאו · מתקדם
CMUX פותר את בעיית התזמון של סוכנים מרובים
CMUX פותר את בעיית התזמון של סוכנים מרובים. הוא מאפשר גישה אגנטית לסוכנים ומאפשר להם לעבוד במקביל. הדבר מאפשר להגדיל את היעילות ולפתור בעיות מורכבות.
04

Vertex AI

productionizing — endpoints, monitoring, IAM, billing.

~3 שעותמתקדם
שיעור

מעבר משלב הפיתוח (Prototyping) לסביבת ייצור (Production) בעולמות ה-AI דורש תשתית רובסטית, סקלאבילית ומאובטחת. פלטפורמת Vertex AI של Google Cloud מספקת את המענה המלא לניהול מחזור החיים של מודלים (MLOps), החל מאימון ועד לפריסה וניטור בזמן אמת. כאשר אנו מדברים על "Productionizing" של מודלים, אנו מתמקדים בארבעה עמודי תווך מרכזיים: נקודות קצה (Endpoints) לחשיפת המודל, ניטור (Monitoring) לזיהוי חריגות והטיות (Drift), ניהול הרשאות (IAM) לאבטחה קפדנית, ובקרת עלויות (Billing) למניעת הפתעות תקציביות.

פריסת מודל ב-Vertex AI מתחילה ביצירת Endpoint - משאב מנוהל המאפשר חשיפת המודל כ-API מאובטח ובעל ביצועים גבוהים. היתרון הגדול טמון ביכולת לבצע פריסות הדרגתיות (Canary Deployments) וחלוקת תעבורה בין גרסאות שונות של המודל ללא השבתת השירות. במקביל, רכיב ה-Model Monitoring של הפלטפורמה עוקב באופן רציף אחר נתוני הקלט והפלט בזמן אמת. הוא משווה אותם לנתוני האימון המקוריים כדי לזהות "זליגת קונספט" (Concept Drift) או "זליגת נתונים" (Feature Drift), ומפעיל התראות אוטומטיות כאשר המודל מתחיל להציג ביצועים ירודים או הזיות.

בסביבות ארגוניות מתקדמות, אבטחה וניהול תקציב הם קריטיים. באמצעות Google Cloud IAM (Identity and Access Management), ניתן להגדיר הרשאות ספציפיות ברמת ה-Service Account, ובכך להבטיח שרק אפליקציות מורשות יוכלו לפנות ל-Endpoints, ושרק מפתחים מורשים יוכלו לעדכן מודלים. מהצד הפיננסי, ניהול Billing ב-Vertex AI דורש הגדרת תקציבים (Budgets), התראות, ותיוג משאבים (Labels) מדויק. שימוש ב-Auto-scaling נכון עבור ה-Endpoints שלכם יבטיח שהמשאבים יצטמצמו לאפס (או למינימום מוגדר) כאשר אין תעבורה, ובכך יחסוך עלויות משמעותיות.

כדי להתחיל לעבוד עם ה-SDK של Vertex AI בפייתון, אנו מייצרים Endpoint ופורסים אליו מודל קיים. הנה דוגמה קצרה המציגה כיצד לאתחל את ה-Client ולפרוס מודל בצורה פרוגרמטית:

from google.cloud import aiplatform

# Initialize Vertex AI SDK
aiplatform.init(project='my-gcp-project', location='us-central1')

# Create an Endpoint
endpoint = aiplatform.Endpoint.create(display_name='my-llm-endpoint')

# Deploy a registered model to the endpoint
model = aiplatform.Model('projects/my-gcp-project/locations/us-central1/models/my-model-id')
deployed_model = endpoint.deploy(
    model=model,
    machine_type='n1-standard-4',
    min_replica_count=1,
    max_replica_count=3
)

כחלק מהתמודדות עם אתגרי ייצור מתקדמים, מומלץ להעמיק במחקרים העוסקים ביציבות ואמינות מודלים. לדוגמה, המאמר הפחתת הזיות ב-LVLM באמצעות ניתוק אורתוגונלי יריב מציע גישות חדשניות לצמצום טעויות פלט במודלים מולטי-מודאליים לפני פריסתם. בנוסף, המאמר שיפור עקביות תיוג באמצעות הגדרות חוקתיות מפורטות והערכה מבוססת AI מציג מתודולוגיה קריטית להערכת איכות הפלט בזמן אמת, כלי חיוני לבניית מערכות ניטור (Monitoring) אפקטיביות ב-Vertex AI.

הצעד הבא שלכם: כדי לתרגם את התיאוריה לפרקטיקה, אנו ממליצים להוריד ולהתקין את פרויקט הקוד הרשמי Generative AI on Vertex AI. פרויקט זה מכיל דוגמאות קצה-לקצה (End-to-End) לפריסת מודלים, מימוש ארכיטקטורות RAG, ובניית סוכני AI (Agents) המוכנים לעבודה בסביבת פרודקשן אמיתית.

פרויקטי התחלה1 REPOS
Generative AI on Vertex AI
★ 11k
python מתקדם
כל הדוגמאות הרשמיות של Vertex AI — fine-tuning, RAG, agents בפרודקשן.
git clone https://github.com/GoogleCloudPlatform/generative-ai
GitHub ↗
חומרי קריאה8 פריטים
01YT AI Engineer · וידאו · מתקדם
DeepSWE: בנצ'מרק לקידוד עמיד בזיהום
DeepSWE הוא בנצ'מרק לקידוד עמיד בזיהום, הכולל 113 משימות קידוד שנכתבו מאפס. הבנצ'מרק מודד את היכולת של מודלים כמו GPT ו-Claude לבצע משימות קידוד מורכבות.
02YT AI Engineer · וידאו · מתקדם
מדוע קטנים? מודלים זעירים וסוכנים ב-Edge/רובוטיקה
צוות Google AI Edge מפתח מודלים קטנים מספיק כדי לרוץ על מכשירים בקצה. מודל Gemma עם 2 מיליארד פרמטרים, מקוטע ל-2.9 ביטים למשקל, רץ על Raspberry Pi. הם גם משתמשים במודלים זעירים, מ-500 מיליון פרמטרים ומטה, שמגיעים למחשבים ישנים ומכשירים זולים.
03YT AI Engineer · וידאו · מתקדם
Vending-Bench: הערכת אג'נטים לטווח ארוך
Vending-Bench הוא פלטפורמה להערכת ביצועים של אג'נטים לטווח ארוך. היא מאפשרת למודלים כמו Gemini, GPT ו-Claude לנהל עסקים מדומים ולהפגין התנהגות מורכבת.
04YT AI Engineer · וידאו · מתקדם
HTML הכל מה שסוכנים צריכים
סוכנים מלמדים לכתוב קוד וידאו באמצעות HTML. החברה HeyGen פיתחה שיטה ליצירת וידאו באמצעות מודלים קטנים ו HTML. הדבר מאפשר יצירת וידאו מתוחכם עם תוצאות דטרמיניסטיות.
05MarkTechPost · כתבה · מתקדם
גוגל משחררת Gemini 3.6 Flash
גוגל השחררה שלושה מודלים חדשים של Gemini: 3.6 Flash, 3.5 Flash-Lite ו-3.5 Flash Cyber. מודלים אלו מיועדים לעבודות אגנטיות ומספקים יעילות גבוהה יותר ופחות עלות. Gemini 3.6 Flash הוא המודל החדש שמספק איכות טובה יותר ומחיר נמוך יותר.
06Pydantic AI · כתבה · בינוני
עדכון v2.14.0: תכונות ותיקונים
עדכון v2.14.0 כולל תכונות חדשות כגון תמיכה ב-reasoning_effort ותיקונים למודלים מיושנים. העדכון כולל גם הסרת מודלים ישנים של Gemini.
07YT AI Engineer · וידאו · מתקדם
מחקר למציאות: Benoit Schillings, Google DeepMind, סגן נשיא מחקר
בנואה שילינגס, סגן נשיא מחקר ב-Google DeepMind, דן בהשפעה המהפכנית של AI יוצרת על הנדסת תוכנה. הוא מציג את הפרויקט Pitchfork ואת העתיד של מודלים וארכיטקטורה.
08Import AI · כתבה · מתקדם
Import AI 464: Fables כותבת ליבת GPU
Fables כותבת ליבת GPU מהירה, מה שמראה על שיפור באוטומציה של מחקר ופיתוח AI. היא השיגה 18.71X תאוצה בהשוואה לבסיסליין מופטורש. זהו צעד חשוב לקראת שיפור היכולת של מערכות AI לפתח ולשפר את עצמן.