דילוג לתוכן הראשי

DeepSeek V4 בדרך, הבית הלבן נכנס לתמונה וגוגל עם צ'יפ חדש: שבוע לוהט ב-AI

שחרור DeepSeek V4, פתיחת המשקולות של Kimi K3, מסגרת פיקוח פדרלית חדשה וצ'יפ Frozen v2 של גוגל - ניתוח מעשי של שבוע שישנה את חשבון העלויות של כל צוות AI.

איתי בר-לב
איתי בר-לב
מומחה פיתוח AI
שיתוף
חדש10 דק׳ קריאה
DeepSeek V4 בדרך, הבית הלבן נכנס לתמונה וגוגל עם צ'יפ חדש: שבוע לוהט ב-AI
חדשות AI
DeepSeek V4 בדרך, הבית הלבן נכנס לתמונה וגוגל עם צ'יפ חדש: שבוע לוהט ב-AI

DeepSeek V4 בדרך, הבית הלבן נכנס לתמונה וגוגל עם צ'יפ חדש: שבוע לוהט ב-AI

השבוע מתרכזים ארבעה אירועים שישפיעו ישירות על ארכיטקטורת ה-AI ועל התקציב שלכם: שחרור הגרסה היציבה של DeepSeek V4 ב-24 ביולי, פתיחת המשקולות של Kimi K3 ב-27 ביולי, הכרזה צפויה של הבית הלבן על מסגרת פיקוח למודלי חזית לפני 1 באוגוסט, ודיווח על צ'יפ שרתים חדש של גוגל בשם Frozen v2. במאמר הזה נפרק כל אירוע לרמת ההשלכות המעשיות: מה כדאי לבדוק, מה כדאי לדחות, ואיפה נפתחת הזדמנות לחיתוך עלויות אמיתי בפרודקשן.

מה קורה השבוע בעולם ה-AI ולמה זה חשוב לבוני מוצרים?

בתמצית: לפי הדיווח של Build Fast with AI, ב-24 ביולי תשוחרר הגרסה היציבה של DeepSeek V4, ב-27 ביולי ייפתחו המשקולות של Kimi K3, לפני 1 באוגוסט הבית הלבן צפוי להכריז על מסגרת פיקוח שתכסה את OpenAI, Anthropic וגוגל אך לא את Meta, וגוגל מפתחת צ'יפ בשם Frozen v2 שלפי מקורות פנימיים יעיל פי 6 עד 10 מה-TPU הנוכחיים.

כל אחד מהאירועים האלה נוגע בציר אחר של קבלת החלטות: בחירת מודל, אסטרטגיית self-hosting, חשיפה רגולטורית ותמחור תשתית. כשארבעתם מתרחשים באותו שבוע, זו נקודת זמן טובה לעצור ולבחון מחדש את שכבת ה-LLM במוצר שלכם, במיוחד אם אתם נעולים על ספק יחיד או משלמים מחירי inference שנקבעו לפני חצי שנה.

ציר הזמן של השבוע

  1. 24 ביולישחרור הגרסה היציבה של DeepSeek V4 - מעבר מ-preview להתחייבות ל-API עקבי ותמחור צפוי
  2. 27 ביוליפתיחת המשקולות של Kimi K3 - שחקן כבד חדש בזירת המודלים הפתוחים ותרחישי הרצה עצמית
  3. לפני 1 באוגוסטהכרזה צפויה של הבית הלבן על מסגרת פיקוח למודלי חזית שתכסה את OpenAI, Anthropic וגוגל - ללא Meta
  4. ברקעדיווח על Frozen v2, צ'יפ שרתים של גוגל שלפי מקורות פנימיים יעיל פי 6 עד 10 מה-TPU הנוכחיים

נתחיל מהאירוע שהכי סביר שישנה לכם את ה-routing כבר בשבועות הקרובים: DeepSeek V4.

DeepSeek V4: מה צפוי בגרסה היציבה ואיך נערכים אליה נכון?

שחרור גרסה יציבה של DeepSeek V4 ב-24 ביולי הוא בעיקר איתות בשלות: המעבר מגרסאות preview לגרסה stable אומר בדרך כלל התחייבות ל-API עקבי, לזמינות גבוהה ולתמחור צפוי. DeepSeek בנתה את המוניטין שלה על יחס עלות-ביצועים אגרסיבי, ולכן ההגעה של V4 לסטטוס יציב רלוונטית לכל מי שמריץ עומסי עבודה בנפח גבוה: סיווג, סיכום, חילוץ מידע מובנה ו-agents פשוטים.

מה זה אומר בפועל? אם יש לכם היום pipeline שמנתב את כל הבקשות למודל פרימיום אחד, זה הזמן לבנות שכבת הערכה (evals) ולהריץ את V4 מול מדגם מייצג של הבקשות האמיתיות שלכם. לא בנצ'מרקים ציבוריים, אלא הדאטה שלכם: הפרומפטים, הפורמטים, השפה. מודל שמנצח ב-benchmark כללי יכול להיכשל בחילוץ שדות מחשבוניות בעברית, ולהפך.

איך בונים בדיקה מהירה של מודל חדש בפרודקשן

  1. אספו 200 עד 500 בקשות אמיתיות ואנונימיות מהלוגים שלכם, כולל מקרי קצה.
  2. הגדירו מדדי הצלחה מדידים: דיוק JSON, נאמנות למקור, זמן תגובה, עלות לאלף בקשות.
  3. הריצו את המודל החדש במקביל למודל הקיים במצב shadow, בלי להחזיר את התוצאה למשתמש.
  4. השוו תוצאות עם שופט אוטומטי (LLM-as-judge) ובדיקה ידנית של מדגם.
  5. אם הפער קטן והעלות נמוכה משמעותית, העבירו תחילה עומסים לא קריטיים דרך router.

הגישה הזו הופכת כל שחרור מודל חדש מאירוע חדשותי להחלטה הנדסית מבוססת נתונים, והיא בדיוק מה שמפריד בין צוותים שרודפים אחרי כותרות לצוותים שחותכים עלויות באופן שיטתי.

בנו את מסלול ההערכה פעם אחת, השתמשו בו לנצח

אל תתייחסו לבדיקת V4 כפרויקט חד-פעמי. מדגם בקשות קבוע, מדדים אוטומטיים ו-router הם תשתית: אחרי שהם קיימים, כל מודל חדש - K3 או הבא בתור - נבדק תוך ימים בודדים במקום להפוך לדיון אינסופי בצוות.

Kimi K3 בקוד פתוח: מה פתיחת המשקולות משנה בפועל?

פתיחת המשקולות של Kimi K3 ב-27 ביולי מוסיפה שחקן כבד לזירת המודלים הפתוחים. משקולות פתוחות (open weights) פירושן שאפשר להוריד את פרמטרי המודל ולהריץ אותו על תשתית שלכם: בענן פרטי, on-prem או דרך ספקי inference שמתמחים באירוח מודלים פתוחים. זה שונה מקוד פתוח מלא, כי לרוב לא מתפרסמים דאטת האימון וקוד האימון, אבל לצורכי פריסה עצמית זה מה שחשוב.

למה זה רלוונטי לחברות ישראליות? שלוש סיבות: ראשית, פרטיות ורגולציה. ארגונים בתחומי בריאות, פיננסים וביטחון שלא יכולים לשלוח דאטה ל-API חיצוני מקבלים עוד אופציה איכותית להרצה מקומית. שנית, שליטה בעלויות: בהיקפי שימוש גבוהים, inference עצמאי על GPU שכורים יכול להיות זול משמעותית מתמחור per-token. שלישית, יכולת fine-tuning על דאטה פנימי, משהו שמודלים סגורים מגבילים או מייקרים.

חשוב לומר את הצד השני בלי הייפ: הרצה עצמית של מודל גדול דורשת צוות שיודע לנהל serving stack (למשל vLLM או TGI), ניטור, quantization וניהול גרסאות. אם הנפח שלכם קטן, ה-API הסגור כמעט תמיד יהיה זול יותר בסך הכול. הנוסחה הפשוטה: חשבו את עלות ה-token החודשית הנוכחית מול עלות GPU קבועה בתוספת שעות DevOps, ורק אם הפער ברור, תתקדמו.

יתרונות

  • פרטיות ורגולציה: הדאטה נשאר אצלכם, קריטי לבריאות, פיננסים וביטחון
  • שליטה בעלויות: בהיקפי שימוש גבוהים, GPU שכורים זולים מתמחור per-token
  • חופש fine-tuning על דאטה פנימי, בלי המגבלות והתמחור של מודלים סגורים

חסרונות / שיקולים

  • דורש צוות שמנהל serving stack (vLLM/TGI), ניטור, quantization וגרסאות
  • בנפחי שימוש קטנים - API סגור כמעט תמיד יוצא זול יותר בסך הכול
  • משקולות פתוחות אינן קוד פתוח מלא: דאטת האימון וקוד האימון לרוב לא מתפרסמים

מסגרת הפיקוח של הבית הלבן: מי בפנים, מי בחוץ ומה המשמעות?

לפי הדיווח, הבית הלבן צפוי להכריז לפני 1 באוגוסט על מסגרת פיקוח למודלי חזית (frontier models) שתחול על OpenAI, Anthropic וגוגל, אך לא על Meta. ההחרגה של Meta בולטת: כנראה בגלל אסטרטגיית המשקולות הפתוחות שלה, שמקשה על מנגנוני פיקוח שנבנו סביב ספקי API מרכזיים. זו נקודה מעניינת, כי היא יוצרת בפועל שני משטרים רגולטוריים שונים לאותה טכנולוגיה.

עבורכם כצרכני API, ההשלכות המעשיות צפויות בשלושה מישורים. ראשית, עלויות ציות אצל הספקים המפוקחים עשויות להתגלגל לתמחור או לזמני שחרור איטיים יותר של יכולות חדשות. שנית, ייתכנו דרישות חדשות סביב תיעוד שימוש, במיוחד ליישומים בתחומים רגישים. שלישית, ההחרגה של מודלים פתוחים עשויה להאיץ אימוץ שלהם בארגונים שרוצים לצמצם תלות בספקים שכפופים למסגרת.

מה כדאי לחברה ישראלית לבדוק כבר עכשיו

גם אם המסגרת אמריקאית, היא נוגעת בכם אם אתם בונים על OpenAI, Anthropic או Gemini. מפו את התלויות שלכם: אילו פיצ'רים במוצר נשענים על ספק יחיד, האם יש לכם שכבת הפשטה (abstraction layer) שמאפשרת החלפת מודל בלי שכתוב, והאם החוזים שלכם עם לקוחות מחייבים אתכם להתחייבויות שתלויות בספק. רגולציה על ספק היא סיכון שרשרת אספקה לכל דבר, וכדאי לנהל אותה כמו כל תלות קריטית אחרת.

Frozen v2 של גוגל: איך צ'יפ חדש משפיע על עלויות ה-AI שלכם?

לפי מקורות פנימיים שצוטטו בדיווח, גוגל מפתחת צ'יפ שרתים בשם Frozen v2 שיעיל פי 6 עד 10 מה-TPU הנוכחיים. חשוב לסייג: מדובר בדיווח על פיתוח, לא בהכרזה רשמית, ומספרי יעילות פנימיים נוטים להתייחס לתרחישים ספציפיים. ובכל זאת, הכיוון ברור: מרוץ החומרה בין גוגל, NVIDIA ושחקניות נוספות ממשיך ללחוץ את עלות ה-compute כלפי מטה.

שבב שרתים על לוח אם, סמל למרוץ החומרה של ענקיות ה-AI
צ'יפים ייעודיים כמו Frozen v2 המדווח דוחפים את עלות ה-compute כלפי מטה - והשינוי מתגלגל בסוף למחירי ה-token שכולנו משלמים. (צילום: Unsplash)

למה זה חשוב גם למי שלא ירכוש צ'יפ בחיים? כי עלות inference היא הרכיב הדומיננטי בתמחור API של מודלים. כשספק תשתית מוזיל לעצמו את החומרה פי כמה, זה מתגלגל בסופו של דבר למחירי token נמוכים יותר, ל-context windows גדולים יותר באותו מחיר, ולמודלים חזקים יותר בשכבות התמחור הזולות. המגמה הזו נמשכת כבר שנים: יכולת שעלתה דולר לפני שנתיים עולה היום סנטים בודדים.

ההשלכה הארכיטקטונית: אל תבנו את המוצר סביב הנחת עלויות של היום. פיצ'ר שנפסל בגלל עלות inference גבוהה ברבעון הזה עשוי להיות כלכלי בעוד שני רבעונים. שמרו רשימת פיצ'רים מושהים עם סף העלות שבו הם הופכים כדאיים, ובחנו אותה מחדש בכל ירידת מחירים משמעותית.

פי 6-10היעילות המדווחת של Frozen v2 לעומת ה-TPU הנוכחיים של גוגל, לפי מקורות פנימיים שצוטטו בדיווח

איך מתרגמים את החדשות להחלטות: מפת דרכים לצוות פיתוח

התשובה הקצרה: בונים גמישות במקום להמר על מנצח. השבוע הזה ממחיש שהשוק משתנה בקצב של ימים, ולכן הנכס האסטרטגי החשוב ביותר הוא ארכיטקטורה שמאפשרת החלפת מודל בעלות נמוכה. בפועל זה אומר שלושה רכיבים: שכבת router אחידה מול כל הספקים, מערך evals אוטומטי שרץ על כל מודל מועמד, וניטור עלויות ברמת פיצ'ר ולא רק ברמת חשבון.

סדר עדיפויות מומלץ לשבועיים הקרובים: ב-24 ביולי הוסיפו את DeepSeek V4 למסלול ההערכה שלכם והריצו אותו במצב shadow על עומסים לא קריטיים. ב-27 ביולי בדקו האם Kimi K3 רלוונטי לתרחישי self-hosting שלכם, ואם כן, בקשו מספקי ה-inference שאתם עובדים איתם הצעת מחיר לאירוח שלו. במקביל, מפו את התלות שלכם בספקים שייכנסו תחת מסגרת הפיקוח האמריקאית.

ולגבי Frozen v2: אין פה פעולה מיידית, אבל יש תזכורת. אם אתם מתמחרים מוצר AI ללקוחות בחוזים ארוכים, בנו מנגנון שמאפשר לכם ליהנות מירידת עלויות עתידית במקום לנעול את עצמכם למרווחים של היום.

רשימת פעולות לשבועיים הקרובים

  • הוסיפו את DeepSeek V4 למסלול ההערכה והריצו אותו במצב shadow על עומסים לא קריטיים
  • בדקו רלוונטיות של Kimi K3 ל-self-hosting ובקשו הצעת מחיר מספקי ה-inference שלכם
  • מפו את התלויות שלכם בספקים שייכנסו תחת מסגרת הפיקוח האמריקאית
  • ודאו שיש לכם שכבת הפשטה שמאפשרת החלפת מודל בלי שכתוב
  • בחוזים ארוכים - הטמיעו מנגנון שמגלגל ירידת עלויות עתידית ללקוח ולכם
  • תחזקו רשימת פיצ'רים מושהים עם סף העלות שבו הם הופכים כדאיים

מבט קדימה: מה הצעד הבא שלכם?

השבוע של DeepSeek V4, Kimi K3, מסגרת הפיקוח האמריקאית ו-Frozen v2 הוא לא רעש חדשותי אלא ארבעה אותות מתואמים: המודלים מתמחרים כלפי מטה, הקוד הפתוח מתחזק, הרגולציה מתגבשת והחומרה מזנקת. צוותים שיבנו עכשיו תשתית הערכה והחלפה גמישה ייהנו מכל גל כזה במקום להיגרר אחריו.

קורס מומלץ מהקטלוג

מאסטר בהנדסת פרומפטים: מאפס למקצוען

הנדסת פרומפטים · מתחילים

אם אתם עומדים להריץ מודלים חדשים כמו DeepSeek V4 ו-Kimi K3 מול הדאטה שלכם, שליטה בהנדסת פרומפטים היא התנאי לכך שההשוואה תהיה הוגנת - הקורס מלמד לבנות פרומפטים עמידים שעובדים בעקביות גם כשמחליפים מודל.

לפרטים והרשמה ←

אם אתם רוצים להעמיק את היכולות המעשיות של הצוות, מהנדסת prompt ועד פריסת מודלים פתוחים בפרודקשן, מומלץ לעיין בקורסי הבינה המלאכותית המעשיים שלנו. ולמעקב שוטף אחרי ההתפתחויות, הניתוחים והשלכותיהן על השוק הישראלי, כל העדכונים מחכים לכם במגזין ה-AI של AICourse.

שאלות נפוצות

מה ההבדל בין משקולות פתוחות לקוד פתוח מלא?

משקולות פתוחות (open weights) מאפשרות להוריד את פרמטרי המודל ולהריץ אותו על תשתית שלכם - בענן פרטי, on-prem או דרך ספקי inference. קוד פתוח מלא כולל גם את דאטת האימון וקוד האימון, שלרוב לא מתפרסמים. לצורכי פריסה עצמית ו-fine-tuning, המשקולות הן מה שחשוב בפועל.

מתי כדאי לעבור ל-self-hosting של מודל כמו Kimi K3?

רק כשהחשבון ברור: השוו את עלות ה-token החודשית הנוכחית מול עלות GPU קבועה בתוספת שעות DevOps. בהיקפי שימוש גבוהים, או כשרגולציה אוסרת לשלוח דאטה ל-API חיצוני, הרצה עצמית משתלמת. בנפחים קטנים, API סגור כמעט תמיד יהיה זול יותר בסך הכול.

איך מסגרת הפיקוח האמריקאית משפיעה על חברות ישראליות?

אם אתם בונים על OpenAI, Anthropic או Gemini - זו תלות בספק שכפוף לרגולציה זרה. עלויות ציות עשויות להתגלגל לתמחור או להאט שחרור יכולות, וייתכנו דרישות תיעוד בתחומים רגישים. נהלו את זה כסיכון שרשרת אספקה: מפו תלויות ובנו שכבת הפשטה להחלפת מודל.

איך בודקים מודל חדש כמו DeepSeek V4 בלי לסכן את הפרודקשן?

אוספים 200-500 בקשות אמיתיות ואנונימיות מהלוגים, מגדירים מדדים מדידים כמו דיוק JSON, זמן תגובה ועלות לאלף בקשות, ומריצים את המודל במצב shadow במקביל לקיים - בלי להחזיר תוצאות למשתמש. רק אם הפער קטן והעלות נמוכה משמעותית, מעבירים עומסים לא קריטיים דרך router.

האם Frozen v2 יוזיל את עלויות ה-AI שלי?

לא מיידית - זה דיווח על פיתוח, לא הכרזה רשמית. אבל המגמה עקבית: כשספקי תשתית מוזילים לעצמם חומרה פי כמה, זה מתגלגל למחירי token נמוכים, ל-context גדול יותר באותו מחיר ולמודלים חזקים בשכבות הזולות. לכן אל תתמחרו חוזים ארוכים לפי עלויות של היום.

מקורות וקריאה נוספת

צפו בהסבר
קורס מומלץ בנושארוצים ליישם את זה בעצמכם? גלו קורסי AI מובחרים
חדשות AIDeepSeekKimi K3גוגלרגולציהחומרת AI

רוצים להעמיק ב-AI?

גלו את מבחר קורסי הבינה המלאכותית — מסוננים לפי תחום, רמה ותקציב.

לקטלוג הקורסים
המשך קריאה

עוד מהמגזין