דילוג לתוכן הראשי

OpenAI משיקה את Astra: המודל החזק ביותר שלה אי פעם, וגם השנוי במחלוקת

OpenAI השיקה את Astra, המודל החזק ביותר שלה עד כה, עם יכולות אוטומציה של דפדפן ומחשב. ניתוח מעשי למפתחים ולעסקים: מה זה אומר בפרודקשן, ולמה ההשקה מעוררת מחלוקת.

איתי בר-לב
איתי בר-לב
מומחה פיתוח AI
שיתוף
חדש9 דק׳ קריאה
OpenAI משיקה את Astra: המודל החזק ביותר שלה אי פעם, וגם השנוי במחלוקת
חדשות AI
OpenAI משיקה את Astra: המודל החזק ביותר שלה אי פעם, וגם השנוי במחלוקת

OpenAI משיקה את Astra: המודל החזק ביותר שלה אי פעם, וגם השנוי במחלוקת

OpenAI Astra הוא המודל החדש שהושק ב-3 בספטמבר, ולפי OpenAI מדובר במודל החזק והמסוגל ביותר שלה עד כה, עם מה שהיא מכנה 'חזית חדשה בשימוש במחשב ובדפדפן'. המודל זמין תחילה ללקוחות תוכנית הסייבר Daybreak, ובשבוע הקרוב יגיע למנויי Pro, Plus, Enterprise ו-Business וגם דרך ה-API. במאמר הזה נפרק את ההשקה מנקודת מבט של בוני מוצר: מה היכולות אומרות בפועל, איך נערכים לשילוב בפרודקשן, ולמה סביב המודל כבר מתנהל ויכוח.

מה זה OpenAI Astra ובמה הוא שונה מהמודלים הקודמים

Astra הוא לא עוד שדרוג הדרגתי של מודל שפה, אלא מודל שממוקד ביכולת לתפעל מחשב ודפדפן באופן אוטונומי. לפי הדיווח של TechCrunch, OpenAI מציגה אותו כמודל המסוגל ביותר שלה אי פעם, כשהדגש המרכזי הוא לא רק על הסקה (reasoning) אלא על ביצוע פעולות: ניווט באתרים, מילוי טפסים, הפעלת אפליקציות והשלמת משימות מרובות שלבים.

ההבדל המהותי עבור מי שבונה מוצרים: מודלים קודמים בקטגוריה הזו, כמו יכולות ה-Computer Use שראינו בשנתיים האחרונות אצל OpenAI ומתחרותיה, סבלו מאמינות נמוכה במשימות ארוכות. שרשרת של עשר פעולות בדפדפן, שכל אחת מהן מצליחה ב-95 אחוז מהמקרים, מסתיימת בהצלחה כוללת של כ-60 אחוז בלבד. אם Astra אכן מזיז את המחוג באמינות של כל צעד בודד, זה מה שהופך אוטומציה כזו משעשוע להדגמות לכלי שאפשר לבנות עליו תהליך עסקי.

~60%שיעור ההצלחה הכולל של שרשרת 10 פעולות בדפדפן כשכל צעד בודד מצליח ב-95% - זו בעיית האמינות ש-Astra מבטיח לפתור

חשוב לומר ביושר: נכון לרגע ההשקה, OpenAI טרם פרסמה מדדי ביצועים מלאים ומאומתים באופן בלתי תלוי. ההמלצה המעשית היא לבחון את המודל על המשימות שלכם, לא על בנצ'מרקים כלליים.

יכולות שימוש במחשב ובדפדפן: מה המשמעות המעשית

המשמעות המעשית של 'שימוש במחשב ובדפדפן' היא שהמודל מקבל צילום מצב של הממשק, מחליט על פעולה (קליק, הקלדה, גלילה), מבצע אותה, ומקבל צילום מצב מעודכן. זו לולאת agent קלאסית: תצפית, החלטה, פעולה, ושוב תצפית, עד להשלמת המשימה או לכישלון מבוקר.

ההשלכה הארכיטקטונית הראשונה: זו לא קריאת API בודדת אלא סשן ארוך ורב-פניות. כל צעד צורך טוקנים של קלט ויזואלי או מבני, ולכן משימה של עשרים צעדים יכולה לעלות פי כמה עשרות מונים מפרומפט טקסטואלי רגיל. כשמתכננים מוצר סביב Astra, מודל העלויות חייב להיבנות לפי משימות ולא לפי קריאות.

איך נראית לולאת עבודה טיפוסית מול המודל

בהתבסס על הדפוס המוכר מכלי Computer Use קיימים, זרימה טיפוסית בצד השרת נראית כך:

  1. שולחים למודל את הגדרת המשימה, למשל: 'הפק דוח חשבוניות מספק X מפורטל הספקים והורד אותו כ-CSV'.
  2. המודל מחזיר פעולה מובנית, למשל click בקואורדינטות מסוימות או type עם מחרוזת.
  3. שכבת ההרצה שלכם (דפדפן headless כמו Playwright, או VM מבודד) מבצעת את הפעולה ומחזירה צילום מסך מעודכן.
  4. הלולאה נמשכת עד שהמודל מדווח על השלמה, או עד שעוברים תקרת צעדים שהגדרתם מראש.

שני העקרונות הקריטיים כאן הם תקרת צעדים (step budget) שמונעת לולאות אינסופיות יקרות, ונקודות אישור אנושי לפני פעולות בלתי הפיכות כמו שליחת תשלום או מחיקת נתונים.

למי Astra זמין עכשיו, ומתי הוא מגיע ל-API

הזמינות מדורגת: בשלב הראשון המודל נפתח ללקוחות תוכנית הסייבר Daybreak של OpenAI, ובמהלך השבוע הקרוב הוא צפוי להגיע למנויי Pro, Plus, Enterprise ו-Business, וכן דרך ה-API למפתחים. הבחירה לפתוח דווקא עם לקוחות סייבר מעניינת: היא מרמזת ש-OpenAI רואה בתחומי אבטחת המידע, בדיקות חדירות מבוקרות וניתוח איומים את מקרי השימוש שבהם היתרון של סוכן אוטונומי בדפדפן הוא המובהק ביותר, וגם את אלה שדורשים את הפיקוח ההדוק ביותר.

לוח הזמנים של הפריסה

  1. 3 בספטמברההשקה הרשמית: OpenAI מציגה את Astra כמודל החזק והמסוגל ביותר שלה אי פעם.
  2. שלב ראשוןגישה בלעדית ללקוחות תוכנית הסייבר Daybreak - רמז לכך ש-OpenAI רואה בסייבר את מקרה השימוש המובהק והמפוקח ביותר.
  3. השבוע הקרובפתיחה למנויי Pro, Plus, Enterprise ו-Business, וכן דרך ה-API למפתחים.

עבור צוותי פיתוח בישראל, חלון הזמן הזה הוא הזדמנות פרקטית: כמה ימים להכין תשתית לפני שהגישה ב-API נפתחת. הכנה טובה כוללת סביבת דפדפן מבודדת, מנגנון לוגים שמתעד כל פעולה של הסוכן, וסט משימות ייחוס (evaluation set) של 20 עד 50 תרחישים אמיתיים מהמוצר שלכם, כדי שתוכלו למדוד את Astra מול הפתרון הקיים כבר ביום הראשון.

למה OpenAI Astra נחשב שנוי במחלוקת

המחלוקת סביב Astra נובעת מהשילוב של עוצמה ואוטונומיה: מודל שיודע להפעיל דפדפן ומחשב בעצמו מרחיב דרמטית את משטח הסיכון, גם לשימוש לרעה וגם לתקלות יקרות. כפי שעולה מהכותרת של TechCrunch עצמה, ההשקה מגיעה עם סימני שאלה ולא רק עם הבטחות.

מנקודת מבט של בוני מוצר, שלושה סיכונים דורשים התייחסות מיידית. הראשון הוא הזרקת פרומפט עקיפה (indirect prompt injection): סוכן שגולש באינטרנט עלול לקרוא דף שמכיל הוראות זדוניות מוסתרות ולפעול לפיהן. זהו כיום וקטור התקיפה המרכזי נגד סוכני דפדפן, ואין לו פתרון מלא. השני הוא פעולות בלתי הפיכות: סוכן עם גישה לחשבונות אמיתיים יכול לשלוח מייל שגוי, לבצע רכישה או לשנות רשומה בפרודקשן. השלישי הוא היבט הסייבר: אותן יכולות שמשרתות בודקי חדירות לגיטימיים יכולות לשמש גם תוקפים, וזו כנראה אחת הסיבות שההשקה מתחילה בתוכנית מבוקרת.

ההשלכה המעשית: אל תתייחסו ל-Astra כאל עובד אמין אלא כאל תהליך אוטומטי חזק שדורש הרשאות מינימליות, סביבה מבודדת ובקרה אנושית בצמתים קריטיים.

הזרקת פרומפט עקיפה: וקטור התקיפה שאין לו פתרון מלא

סוכן שגולש באינטרנט עלול לקרוא דף שמכיל הוראות זדוניות מוסתרות ולפעול לפיהן. לכן עוד לפני שורת האינטגרציה הראשונה: הרשאות מינימליות, רשימת דומיינים מותרים ברמת הרשת, ואישור אנושי לפני כל פעולה בלתי הפיכה כמו תשלום או מחיקת נתונים.

איך משלבים את Astra בפרודקשן: שיקולי ארכיטקטורה

שילוב אחראי של Astra בפרודקשן מתחיל מעיקרון אחד: הסוכן רץ בסביבה שאתם שולטים בה, לא על תחנת עבודה של משתמש. בפועל זה אומר קונטיינר או VM ייעודי לכל סשן, עם דפדפן נקי, בלי קוקיז של חשבונות רגישים, ועם רשימת דומיינים מותרים (allowlist) ברמת הרשת.

מנעול דיגיטלי המסמל פריסה מאובטחת של סוכן AI אוטונומי
העיקרון הראשון בפרודקשן: הסוכן רץ בסביבה שאתם שולטים בה - קונטיינר מבודד, דפדפן נקי ו-allowlist ברמת הרשת. (צילום: Unsplash)

שכבת ההרשאות: המפתח לפריסה בטוחה

מודל ההרשאות הנכון הוא הדרגתי. מתחילים במצב קריאה בלבד: הסוכן גולש, אוסף מידע ומפיק דוחות, אבל כל פעולת כתיבה נחסמת. בשלב השני מאפשרים פעולות כתיבה הפיכות בלבד, כמו שמירת טיוטה. רק אחרי שצברתם מאות ריצות מתועדות עם שיעור הצלחה שאתם מרוצים ממנו, פותחים פעולות בעלות השפעה, ותמיד עם צעד אישור אנושי (human in the loop) לפני ביצוע.

בצד התפעולי, שלושה רכיבים שכדאי לבנות מראש:

  • תיעוד מלא של הסשן: צילומי מסך של כל צעד, הפעולה שנבחרה והנימוק. בלי זה אי אפשר לדבג כישלונות ואי אפשר לעמוד בדרישות ביקורת.
  • Timeout ותקציב לכל משימה: תקרת צעדים, תקרת זמן ותקרת עלות בטוקנים, עם כשל מבוקר (fail closed) כשחוצים אותן.
  • מנגנון fallback: כשהסוכן נכשל, המשימה עוברת לתור אנושי עם כל ההקשר, במקום להיעלם.

עשו

  • התחילו במצב קריאה בלבד ופתחו הרשאות כתיבה בהדרגה, מהפיכות בלבד
  • תעדו כל צעד בסשן: צילום מסך, הפעולה שנבחרה והנימוק
  • הגדירו תקרת צעדים, זמן ועלות בטוקנים עם כשל מבוקר (fail closed)
  • בנו fallback: משימה שנכשלת עוברת לתור אנושי עם כל ההקשר

אל תעשו

  • אל תריצו את הסוכן על תחנת עבודה של משתמש עם קוקיז של חשבונות רגישים
  • אל תאפשרו פעולות בעלות השפעה בלי צעד אישור אנושי לפני ביצוע
  • אל תדלגו על שלב מאות הריצות המתועדות לפני הרחבת ההרשאות

מקרי שימוש קונקרטיים לעסקים ולמפתחים בישראל

מקרי השימוש המשתלמים ביותר בשלב הזה הם משימות דפדפן חוזרות, מובנות ובעלות סיכון נמוך. כמה דוגמאות שרלוונטיות במיוחד לשוק הישראלי: הפקת דוחות מפורטלים ממשלתיים ובנקאיים שאין להם API, כמו הורדת אסמכתאות מפורטלי ספקים; תפעול בק-אופיס במסחר אלקטרוני, כמו עדכון מלאי מול ספקים שעובדים רק דרך ממשק ווב; ובדיקות QA של זרימות משתמש מקצה לקצה, שבהן הסוכן מריץ תרחישים בעברית על הממשק האמיתי ומדווח על שברים.

בתחום הסייבר, שהוא נקודת הפתיחה של ההשקה דרך Daybreak, הכיוון המתבקש הוא אוטומציה של תחקור: איסוף ראיות ממערכות ניהול, הצלבת התרעות בין דשבורדים ותיעוד ממצאים. אלו משימות שגוזלות מאנליסטים שעות, מובנות מספיק כדי שסוכן יצליח בהן, ורגישות מספיק כדי להצדיק את שכבות הבקרה שתיארנו.

דשבורד גרפים ואנליטיקה מהסוג שסוכן AI יכול לתחקר ולתעד
הצלבת התרעות בין דשבורדים ואיסוף ראיות ממערכות ניהול - משימות שגוזלות מאנליסטים שעות ומתאימות לסוכן עם שכבות בקרה. (צילום: Unsplash)

המבחן הכלכלי פשוט: משימה מתאימה לאוטומציה עם Astra אם היא חוזרת לפחות עשרות פעמים בחודש, עלות כישלון בודד בה נמוכה, ועלות הריצה בטוקנים נמוכה משמעותית מעלות הזמן האנושי שהיא חוסכת. משימות חד-פעמיות או קריטיות עדיין עדיף להשאיר לבני אדם או לאוטומציה דטרמיניסטית.

מה עושים עכשיו: צעדים ראשונים לקראת הגישה ב-API

ההשקה של Astra מסמנת את המעבר של סוכני מחשב ודפדפן מניסויים למרכז הבמה, אבל הערך האמיתי יגיע רק למי שייגש אליה עם תשתית מדידה ובקרה מסודרת. התחילו במיפוי שלוש עד חמש משימות דפדפן חוזרות בארגון, בנו סביבת הרצה מבודדת עם לוגים, והגדירו מראש מה נחשב הצלחה. כשהגישה ב-API תיפתח בימים הקרובים, תוכלו להריץ השוואה אמיתית במקום להתרשם מהדגמות.

מוכנים ליום פתיחת ה-API? רשימת היערכות

  • מפו 3 עד 5 משימות דפדפן חוזרות, מובנות ובסיכון נמוך בארגון
  • הקימו סביבת הרצה מבודדת: קונטיינר או VM עם דפדפן נקי ו-allowlist
  • בנו מנגנון לוגים שמתעד כל פעולה של הסוכן
  • הכינו סט ייחוס של 20 עד 50 תרחישים אמיתיים מהמוצר שלכם
  • הגדירו מראש מה נחשב הצלחה, ומהן תקרות הצעדים, הזמן והעלות
  • קבעו נקודות אישור אנושי לפני פעולות בלתי הפיכות

אם אתם רוצים להעמיק בבניית סוכני AI ואוטומציה בסביבת עבודה אמיתית, מחכים לכם קורסי בינה מלאכותית מעשיים למפתחים ולעסקים שמכסים בדיוק את התחומים האלה. ולמעקב שוטף אחרי ההשקות והמגמות בתעשייה, כולל ניתוחים טכניים כמו זה, שווה לעקוב אחרי מגזין החדשות והמדריכים שלנו בתחום ה-AI. הימים הקרובים, כשהמודל ייפתח לכלל המנויים ול-API, יגלו אם Astra אכן מקיים את ההבטחה, ומי שהתכונן מראש יידע לענות על השאלה הזו בעצמו, עם הנתונים שלו.

שאלות נפוצות

מה זה OpenAI Astra ובמה הוא שונה ממודלים קודמים?

Astra הוא מודל חדש של OpenAI שהושק ב-3 בספטמבר ומוצג כחזק והמסוגל ביותר שלה עד כה. בשונה משדרוג הדרגתי של מודל שפה, הדגש הוא על תפעול אוטונומי של מחשב ודפדפן: ניווט באתרים, מילוי טפסים, הפעלת אפליקציות והשלמת משימות מרובות שלבים - לא רק הסקה טקסטואלית.

מתי Astra יהיה זמין דרך ה-API למפתחים?

הזמינות מדורגת: בשלב הראשון המודל נפתח ללקוחות תוכנית הסייבר Daybreak, ובמהלך השבוע הקרוב הוא צפוי להגיע למנויי Pro, Plus, Enterprise ו-Business וכן דרך ה-API. את הימים האלה כדאי לנצל להכנת סביבת הרצה מבודדת, מנגנון לוגים וסט משימות ייחוס למדידה.

למה Astra נחשב שנוי במחלוקת?

השילוב של עוצמה ואוטונומיה מרחיב דרמטית את משטח הסיכון: הזרקת פרומפט עקיפה מדפים זדוניים, פעולות בלתי הפיכות בחשבונות אמיתיים, ויכולות סייבר שיכולות לשמש גם תוקפים. בנוסף, נכון לרגע ההשקה OpenAI טרם פרסמה מדדי ביצועים מלאים ומאומתים באופן בלתי תלוי.

אילו משימות כדאי לאוטומט עם Astra בשלב הזה?

משימות דפדפן חוזרות, מובנות ובעלות סיכון נמוך: הפקת דוחות מפורטלים ממשלתיים ובנקאיים ללא API, תפעול בק-אופיס במסחר אלקטרוני, בדיקות QA מקצה לקצה ותחקור סייבר. המבחן הכלכלי: המשימה חוזרת עשרות פעמים בחודש, עלות כישלון בודד נמוכה, ועלות הטוקנים נמוכה מהזמן האנושי הנחסך.

איך שולטים בעלויות של סוכן מבוסס Astra?

סשן סוכן הוא ארוך ורב-פניות, וכל צעד צורך טוקנים של קלט ויזואלי - משימה של עשרים צעדים יכולה לעלות פי כמה עשרות מונים מפרומפט רגיל. בנו מודל עלויות לפי משימות ולא לפי קריאות, והגדירו תקרת צעדים, תקרת זמן ותקרת עלות עם כשל מבוקר.

מקורות וקריאה נוספת

צפו בהסבר
קורס מומלץ בנושארוצים ליישם את זה בעצמכם? גלו קורסי AI מובחרים
חדשות AIOpenAIAstraסוכני AIאוטומציהמפתחים

רוצים להעמיק ב-AI?

גלו את מבחר קורסי הבינה המלאכותית — מסוננים לפי תחום, רמה ותקציב.

לקטלוג הקורסים
המשך קריאה

עוד מהמגזין