ב-3 בספטמבר 2026 השיקה OpenAI את GPT-6 Astra - מודל שהיא עצמה מתארת כ"קפיצת מדרגה של דור" וכזה שעשוי להיחשב כהגעה לבינה מלאכותית כללית. אבל הכותרת החשובה יותר לארגונים אינה היכולות המרשימות - היא ההודאה הרשמית של OpenAI ש-Astra הוא המודל הראשון שלה שחוצה סף "Critical" באבטחת סייבר, כלומר מסוגל לאתר ולנצל חולשות אבטחה שלא היו ידועות קודם, במערכות מוגנות היטב, כמעט בלי הכוונה אנושית. המאמר הזה בוחן מה בדיוק הוכרז, מה זה אומר ברמה עסקית וממשלית, ומה הארגון שלכם צריך לעשות איתו - בלי לפרט אף פרט טכני-מבצעי.
📋 מה תמצאו במאמר
- מה בדיוק הושק היום
- העובדות שכדאי לדעת
- שלוש יכולות שמייחדות את Astra
- הבנצ'מרקים: המספרים מאחורי ההשקה
- תמחור וחלון הקשר
- תגובה ראשונה מהשטח: מה בונה AI אחד כבר בנה
- ההדגמה שהציגה OpenAI בהשקה
- הסף שאף מודל של OpenAI לא חצה לפניו
- ההגנות שתוארו - ולמה זה לא נגמר שם
- "Opaque Recurrence": המחלוקת שבתוך ההשקה
- מי מקבל גישה ומתי - Daybreak ותוכניות המנוי
- Astra מול Claude Mythos 5.1: שתי פילוסופיות ממשל
- מה זה אומר למדיניות ה-AI של הארגון שלכם
- שלוש שאלות לשאול השבוע
- שאלות נפוצות
המאמר מבוסס על דיווחי TechCrunch, VentureBeat, Axios, CNBC ו-the-decoder מיום ההשקה עצמו, על ה-System Card הרשמי של OpenAI ב-deploymentsafety.openai.com, ועל נתוני בנצ'מרקים ותמחור מ-DataCamp ומ-Artificial Analysis (מאגר השוואת מודלים עצמאי). הדף הרשמי openai.com/index/gpt-6-astra חסם גישה ישירה - הנתונים ממנו מגיעים דרך מקורות שמצטטים אותו. סעיף "תגובות מהשטח" מבוסס על פוסט אישי של בונה AI - מסומן בבירור כחוות דעת סובייקטיבית, לא כעובדה מאומתת. בכל מקום שבו פרט לא היה חד-משמעי בין מקורות - כמו תהליך האישור המדויק לתוכנית Daybreak - זה כתוב כאן ככה, לא כתשובה מומצאת. ב-Think-AI אנחנו מלווים ארגונים באבטחת מידע סביב AI ובבניית מדיניות AI ארגונית - הזווית של המאמר הזה היא בדיוק התחום שלנו.
מה בדיוק הושק היום
OpenAI הכריזה על תחילת הפריסה של GPT-6 Astra - "משפחת המודל הבא" שלה, לדבריה תוצר של "שנות מחקר והימורים גדולים". נשיא החברה, גרג ברוקמן, תיאר אותו כמודל ה"אינטליגנטי ביותר, וגם - חשוב לא פחות - המיושר ביותר" שהחברה אי-פעם שחררה, וכ"שינוי אמיתי בסוג העבודה שאפשר להאציל ל-AI".
ההשקה לא הייתה ספונטנית: כבר ב-1 בספטמבר, יומיים לפני ההשקה המלאה, פרסמה OpenAI שהגישה ליכולות הסייבר המתקדמות ביותר של המודל תהיה מוגבלת יותר מהמתוכנן. ולפי דיווח קודם מ-7 באוגוסט, OpenAI כבר עיכבה בעבר את שחרור המודל בשל חששות אבטחת סייבר, ועדכנה מרשויות ממשלתיות בארה"ב על כך מרצונה.
העובדות שכדאי לדעת
מה שמאומת ממספר מקורות עצמאיים - דיווחי חדשות וה-System Card הרשמי:
חשוב לדייק: הבעיות שנפתרו - בגיאומטריה גבוהת-מימדים, תורת הקבוצות, מורכבות קוונטית, קריפטוגרפיה של סריגים וקומבינטוריקה קיצונית - הן הישג מדעי אמיתי, אך הן אינן מבעיות פרס המילניום (שבע הבעיות המתמטיות היוקרתיות ביותר בעולם, שרק אחת מהן נפתרה עד היום). מקורות ההשקה עצמם מציינים זאת במפורש.
שלוש יכולות שמייחדות את Astra
1. שימוש במחשב ובדפדפן ברמה חדשה
OpenAI מתארת את Astra כ"חזית חדשה בשימוש במחשב ובדפדפן", עם טיפול במשימות ב"מהירות, דיוק ובטיחות" שלא היו קיימים בדגמים קודמים - כולל ביצוע משימות טרמינל וניתוח בסיסי קוד ברמה שדורגה כמשמעותית מעל הדגמים הקודמים בסדרה.
2. עבודה עצמאית לאורך זמן
לפי הדיווחים, Astra מסוגל לעבוד על בעיות במשך שעות ואף ימים, ולתאם מספר סוכנים לאורך תקופה ממושכת - לא רק תגובה בודדת לשאלה בודדת. זו בדיוק היכולת שמאפשרת פתרון בעיות מחקר מורכבות כמו עשר בעיות המתמטיקה שהוזכרו למעלה.
3. אימון מבוסס-מודלים בקנה מידה חדש
Astra נבנה על ריצת האימון הגדולה ביותר אי-פעם של OpenAI, ולפי הדיווחים הוא המודל הראשון שבו מודלים אחרים משחקים תפקיד משמעותי בפיקוח על תהליך האימון עצמו - שכבת אוטומציה נוספת בתוך תהליך הפיתוח שמעלה גם שאלות פיקוח משלה, כפי שיפורט בהמשך.
הבנצ'מרקים: המספרים מאחורי ההשקה
לצד ההכרזות המילוליות, OpenAI פרסמה סדרת ציוני בנצ'מרק שמצטטים מקורות עצמאיים כמו DataCamp ו-Artificial Analysis. הטבלה הבאה מרכזת את המספרים המרכזיים, כולל השוואה לדגם הקודם בסדרה (GPT-5.6 Sol) ולמודלים מובילים של Anthropic. הכוכבית ליד ARC-AGI-3 מוסברת מיד אחרי הטבלה - זו לא הערה שולית.
| בנצ'מרק | GPT-6 Astra | GPT-5.6 Sol (קודם) | Claude (Fable 5.1 / Opus 5) |
|---|---|---|---|
| FrontierMath Tier 4 v2 (מתמטיקה) | 97.6% | - | 87.8% / 73.2% |
| GPQA Diamond (ידע מדעי) | 96.0% | - | - |
| OSWorld 2.0 (שימוש במחשב) | 72.6% | 65.7% | 70.2% (Opus 5, ל-Fable 5.1 אין נתון) |
| ScreenSpot-Pro (זיהוי ממשק) | 92.7% | 76.9% | - |
| Terminal-Bench 4.0 (קידוד) | 57.7% | - | 55.8% (Fable 5.1, כמעט תיקו) |
| DeepSWE v1.1 (הנדסת תוכנה) | 74.1% | - | - |
| ARC-AGI-3 (הסקה כללית) | 99.9%* | - | - |
זה בדיוק סוג המספר שצריך לקרוא בזהירות. ציון ה-99.9% ב-ARC-AGI-3 הושג עם "רתמת מתאם עתירת-מצב" (stateful adapter harness) - תשתית הרצה יקרה ומיוחדת שרוב המשתמשים לא יריצו בפועל. כשאותו מבחן רץ בקריאות API רגילות וללא-מצב (stateless) - כפי שרוב היישומים בפועל עובדים - הציון צונח ל-17%-63% בלבד, טווח ענק שתלוי לגמרי באופן ההרצה. המסקנה המעשית: אל תסמכו על ציון הבנצ'מרק המפורסם כאילו הוא מה שתקבלו "מהקופסה" - זה בדיוק סוג הפער בין דמו מבוקר לביצועים בפריסה אמיתית.
גם בתחום אבטחת הסייבר פורסמו ציונים - ExploitBench: 100% (מול 78.5% ב-GPT-5.6 Sol) ו-SRE-Bench: 88% הצלחה בניסיון בודד. אלה בדיוק המספרים שמעמידים בהקשר את הסיווג "Critical" שהוזכר קודם במאמר: זו לא הערכה איכותית מעורפלת, אלא ציון בנצ'מרק מפורסם וממוסד שממחיש עד כמה היכולת השתפרה לעומת הדגם הקודם.
מדד מרוכז אחד: לפי Artificial Analysis, Astra מדורג #8 מתוך 202 מודלים במדד האינטליגנציה המצרפי שלהם (Artificial Analysis Intelligence Index, ציון 61) - "בין המודלים המובילים באינטליגנציה, אך יקר במיוחד ביחס למודלים אחרים באותו טווח מחיר", כלשונם.
תמחור וחלון הקשר
| מפרט | ערך |
|---|---|
| מחיר קלט (Standard) | $10 למיליון טוקנים |
| מחיר פלט (Standard) | $50 למיליון טוקנים |
| מצב Fast (מהירות כפולה) | $20 / $100 למיליון |
| הנחת cache | עד 90% |
| חלון הקשר | 1 מיליון טוקנים |
| מועד קפאון ידע (knowledge cutoff) | 30 באפריל 2026 |
נקודת השוואה שימושית: מחיר ה-Standard ($10/$50 למיליון) גבוה פי כ-2.5 מהמחיר המבצעי שהיה ל-Sol, אך תואם בדיוק את התמחור של Claude Fable 5.1 של Anthropic - שני הספקים המובילים מתמחרים כעת את שכבת הדגם המתקדמת ביותר שלהם באותה רמה בדיוק, מה שמרמז על תיאום שוק ולא רק על החלטת תמחור עצמאית.
תגובה ראשונה מהשטח: מה בונה AI אחד כבר בנה
בניגוד לסעיף הבנצ'מרקים שלמעלה, מה שמובא כאן הוא חוות דעת סובייקטיבית של בונה AI יחיד ביום ההשקה - לא מדידה עצמאית או מוסמכת. מדובר בפוסט בניוזלטר עם תוכן ממומן (חסות של חברת BuildBetter מופיעה בפוסט), מה שלא פוסל אותו כמקור אך כן מחייב לקרוא אותו ככזה - התלהבות אמיתית מניסיון אישי, לא אימות בלתי-תלוי.
Matt Shumer, בונה AI מוכר שעבד בעבר על "סוכני דפדפן" מוקדמים בחברת HyperWrite, פרסם ביום ההשקה עצמו פוסט בניוזלטר שלו "Something Big Is Happening" עם ההתרשמות הראשונית שלו מ-Astra. הציטוט הפותח שלו, בתרגום חופשי: "Astra החזיר אותי - זה הכלי שהייתי ממליץ עליו לשימוש יומיומי כמעט לכל אחד".
שלושה פרויקטים שהוא מתאר שהריץ עם המודל:
- אפליקציה שתיקנה את עצמה לבד: לדבריו, הוא כתב הודעה קצרה בסגנון "down, please fix" (נפול, בבקשה תתקן) והניח את הטלפון בצד - ושעה אחר כך קיבל הודעה שהמערכת חזרה לפעול. הוא לא פירט מה הייתה התקלה הטכנית המדויקת.
- "ציוויליזציה מדומה": עולם עם בעלי חיים ואנשים, כשכל דמות מופעלת על ידי סוכן Astra נפרד - לדבריו נבנה מפרומפט אחד שהוא הריץ ונתן למודל לעבוד עליו לבד. לא צוין משך זמן מדויק.
- שחזור של ניו יורק ב-Unreal Engine: תיאור "גרסת GTA" של העיר, שלבנייתה השתמש במודל בשלבים - לדבריו הפרויקט "עדיין בעיצומו" ולא הושלם.
ההשוואה שלו ל-Claude ממוקדת ומעניינת: Claude עדיין עדיף בטעם ויזואלי וביצירת נכסים גרפיים, בעוד ש-Astra עדיף בעבודת backend, הנדסה יומיומית והבנת כוונה. זו בדיוק אותה חלוקת עבודה שעולה גם מהבנצ'מרקים הרשמיים למעלה - Astra מוביל במתמטיקה, קידוד ושימוש בכלים, לא בהכרח בפלט ויזואלי-קריאייטיבי. הפוסט מתייחס גם לClaude Fable 5.1 של Anthropic - סימן לכך שלפחות חלק מהבונים בשטח כבר משווים בין שני המודלים בפועל, לא רק לפי כותרות. חשוב לזכור: זו עדיין נקודת מבט אחת בלבד, לא מדגם רחב.
ההדגמה שהציגה OpenAI בהשקה
לפי דיווחים מההשקה, OpenAI הציגה סרטון קידום שנפתח בהדגמת AI מהשנות ה-80 - אדם מבקש ממחשב לצייר עיגול צהוב, וזה מה שהוא עושה - ואז עובר להווה: עובדי OpenAI מדברים עם Astra בקול, מבקשים ממנו להפוך את אותו עיגול צהוב לחללית, ואז לבנות ממנה משחק תלת-ממדי מלא תוך דקות, ואף ליצור רישום מוצר באתר eBay - הכול מקלט קולי בלבד, בלי הקלדה.
למרות חיפוש ממוקד, לא איתרנו קישור מאומת לערוץ היוטיוב הרשמי של OpenAI עבור סרטון ההשקה הספציפי הזה. מצאנו כמה סרטוני תגובה של ערוצי צד שלישי, אך בחרנו שלא לשבץ אותם כאן בתור "מקור רשמי" - זה יהיה מטעה. אם וכאשר יעלה קישור רשמי מאומת, המאמר יעודכן.
הסף שאף מודל של OpenAI לא חצה לפניו
זה הסעיף החשוב ביותר במאמר. OpenAI מפעילה מסגרת פנימית בשם Preparedness Framework שמסווגת מודלים לפי רמת סיכון בתחומים רגישים - כולל אבטחת סייבר, ביולוגיה/כימיה, ויכולת המודל "לשפר את עצמו". לפי ה-System Card הרשמי, Astra הוא המודל הראשון של OpenAI שחוצה את הרמה "Critical" באבטחת סייבר בפריסה רחבה.
המשמעות, כפי שמתוארת במקור הרשמי: מודל ברמה הזו מסוגל לאתר חולשות אבטחה שלא היו ידועות קודם, ולפתח דרכי ניצול חדשות עבורן במערכות מוגנות היטב - כמעט בלי שאדם צריך להנחות אותו צעד-צעד בכל שלב. מעבר לסייבר, ה-System Card מציין שהמודל נבדק גם בתחומי ביולוגיה/כימיה (ברמות High ו-Critical) וביכולת שיפור-עצמי של AI - וששני התחומים האלה הפעילו אמצעי בטיחות מוגברים גם הם.
הסיווג הזה אינו דליפה או חשיפה עיתונאית - הוא הכרזה יזומה ומתועדת של OpenAI עצמה, שבחרה לעכב את השחרור בשבועות ולעדכן רשויות ממשלתיות בארה"ב מרצונה, לפני שהחליטה לשחרר את המודל עם הגנות נוספות. זה שקוף לחלוטין - וזו בדיוק הסיבה שהארגון שלכם צריך להתייחס לזה ברצינות, ולא כרעש שיווקי.
ההגנות שתוארו - ולמה זה לא נגמר שם
לפי ה-System Card, OpenAI הטמיעה מספר שכבות הגנה סביב Astra:
- ניטור מלא של שרשראות ההיגיון והפעולות של המודל.
- הערכת יישור (alignment) שנחסמת לפני שימוש פנימי - בדיקה מוקדמת לפני שהמודל עצמו משמש בפיתוח.
- הצפנת checkpoints ובקרות גישה מוגברות לקבצי המודל עצמם.
- ניטור אי-יישור (misalignment) על כל שימוש חיצוני בכלים.
- מוניטורים למניעת שימוש לרעה בזמן אמת.
בנוסף, OpenAI מדווחת ששיעור דחיית ניסיונות jailbreak סטטיים עולה על 95% בכל הקטגוריות שנבדקו, עם עמידות משופרת גם מול תוקפים אדפטיביים רב-סבביים, ועם הכללה טובה יותר לתוקפים שלא נבדקו מראש - שיפור לעומת הדגם הקודם בסדרה, GPT-5.6 Sol.
אבל הגנות טכניות מצד הספק אינן פתרון שלם - הן מטפלות בשימוש לרעה ישיר במודל, לא בשאלה הארגונית של מי בארגון שלכם צריך גישה בכלל, למה, ובאילו תנאים. זו בדיוק הפער שממשל AI ארגוני אמור לסגור.
"Opaque Recurrence": המחלוקת שבתוך ההשקה
מעבר לסיכון אבטחת הסייבר, ישנה מחלוקת נפרדת שנחשפה בדיווחי ההשקה: Astra משתמש בטכניקת חשיבה חדשה שכונתה "opaque recurrence" - שיטה שמשפרת ביצועים, אך כתופעת לוואי מטשטשת את היכולת של חוקרים לעקוב אחרי "שרשרת המחשבה" של המודל ולבקר את ההחלטות שלו.
מדען הראשי של OpenAI, יעקב פחוצקי, התייחס לכך ישירות בציטוט שדווח (בתרגום חופשי לעברית): "ככל שיכולות המודל גדלות, כך מתקשה היכולת לפקח עליו". זה לא ציטוט שולי - זו הודאה של אחד מבכירי הבטיחות בחברה שהמודל שהיא עצמה שחררה קשה יותר לביקורת פנימית מקודמיו, בדיוק בזמן שהיכולות שלו מסוכנות יותר.
מי מקבל גישה ומתי - Daybreak ותוכניות המנוי
הגישה מדורגת בשלבים:
| שלב | מי מקבל גישה |
|---|---|
| שלב 1 - ראשון | ארגונים בתוכנית Daybreak (אבטחת סייבר, מבוססת בקשה) |
| שלב 2 | מנויי ChatGPT Plus, Pro, Business ו-Enterprise |
| שלב 3 | API של OpenAI (פריסה הדרגתית לאורך כשבוע) ו-AWS |
השילוב הזה מעניין: תוכנית Daybreak נועדה לתת לצוותי הגנה גישה מוקדמת כדי שיוכלו לזהות ולתקן חולשות אצלם לפני שגורמים עוינים יעשו זאת - אבל בניגוד לתוכניות אימות דומות אצל ספקים אחרים, כאן הגישה הרחבה מגיעה מיד אחרי, לא נשארת חסומה לצמיתות.
Astra מול Claude Mythos 5.1: שתי פילוסופיות ממשל
במקרה, זה קרה כמעט באותה תקופה: Anthropic הכריזה על Claude Mythos 5.1 - מודל עם הגנות מוקלות בתחומי סייבר ומדעי החיים, נגיש רק דרך תוכניות אימות ייעודיות. ההשוואה בין השניים חושפת שתי אסטרטגיות שונות לגמרי לניהול סיכון:
| ממד | GPT-6 Astra (OpenAI) | Claude Mythos 5.1 (Anthropic) |
|---|---|---|
| גישה ראשונית | תוכנית Daybreak (סייבר, מבוססת בקשה) | תוכניות אימות (סייבר + מדעי חיים) |
| גישה לטווח ארוך | נפתח למנויי Plus/Pro/Business/Enterprise + API | נשאר סגור מאחורי אימות - ללא מנוי צרכני |
| היקף הקהל | רחב - כל מנוי בתשלום | צר - רק גורמים מאומתים |
| פילוסופיית הממשל | מדורג-אך-מתרחב לרוחב | מדורג-אך-מוגבל לצמיתות |
לארגון שמעריך אילו ספקי AI לאמץ, זה שיקול ממשל לגיטימי - לא רק שאלת יכולות. אימוץ מודל עם גישה רחבה יותר לרמת סיכון גבוהה דורש בקרות פנימיות חזקות יותר, לא פחות.
מה זה אומר למדיניות ה-AI של הארגון שלכם
גם ארגון שלא ישתמש ב-Astra צריך להתייחס להשקה הזו, מסיבה פשוטה: מודל ברמת "Critical" זמין עכשיו דרך מנוי אישי בתשלום - לא דרך רכישה ארגונית מבוקרת. עובד עם מנוי ChatGPT Plus או Pro פרטי יכול להשתמש בו על מחשב העבודה בלי שה-IT בכלל יודע.
זה בדיוק התרחיש שמדיניות AI ארגונית אמורה לכסות - לא רק "אילו כלי AI מאושרים" אלא "מה עושים כשכלי AI מאושר מגיע לרמת יכולת שלא הייתה קיימת כשהמדיניות נכתבה". מדיניות AI ארגונית עם רמות גישה מוגדרות וסקירה תקופתית היא הכלי הנכון להתמודד עם זה - במיוחד כשמודלים חדשים ברמות סיכון חדשות משתחררים בקצב הזה.
בערוץ ה-Enterprise, לפי הדיווחים, Astra מגיע כברירת מחדל כבוי - מנהל המערכת חייב להפעיל אותו במפורש לפני שהוא זמין לעובדים. זו נקודת בקרה קונקרטית וממשית שכבר קיימת אצל OpenAI, לא המצאה של המאמר הזה. הצעד המעשי המיידי לארגון שכבר נמצא על Enterprise: לוודא מול מנהל ה-IT שההפעלה לא בוצעה אוטומטית או בטעות, ושההחלטה להפעיל אותה מתקבלת במודע ולא ברירת מחדל.
שלוש שאלות לשאול השבוע
- האם מדיניות ה-AI שלנו בכלל מתייחסת לרמות סיכון כמו "Critical"? אם לא - זה הזמן להוסיף סעיף מפורש, לא לחכות למקרה הבא.
- מי בארגון כבר משתמש במודלים כאלה דרך מנוי אישי, בלי שאנחנו יודעים? זה לא שאלה תיאורטית - היא רלוונטית מהיום הראשון של ההשקה.
- יש לנו ערך הגנתי בהצטרפות לתוכנית כמו Daybreak? כלי שתוקפים עלולים לנצל הוא גם כלי שצוות ההגנה שלכם עשוי להזדקק לו כדי להקדים אותם.
- Astra הוא המודל הראשון של OpenAI שחוצה סף "Critical" באבטחת סייבר לפי הסיווג הפנימי של החברה עצמה - הכרזה שקופה, לא דליפה.
- הגישה מדורגת אך מתרחבת: Daybreak ראשון, ואז מנויי Plus/Pro/Business/Enterprise + API - היקף רחב יחסית למודל ברמת סיכון כזו.
- "Opaque recurrence" מקשה על ביקורת פנימית בדיוק כשהיכולות מסוכנות יותר - הודאה מפורשת ממדען הראשי של OpenAI.
- 10 בעיות מתמטיות פתוחות נפתרו - הישג אמיתי, לא מבעיות פרס המילניום, ולא הוכחה ל-AGI.
- ציון בנצ'מרק "המרשים ביותר" (99.9% ב-ARC-AGI-3) דורש קריאה זהירה - הושג בתשתית מיוחדת ויקרה; בקריאות API רגילות הציון צונח ל-17%-63%.
- התמחור זהה בין OpenAI ל-Anthropic ($10/$50 למיליון טוקנים) - שני הספקים מתמחרים את השכבה המתקדמת שלהם באותה רמה בדיוק.
- ההשוואה ל-Claude Mythos 5.1 חושפת שתי אסטרטגיות ממשל שונות - גישה מתרחבת מול גישה מוגבלת לצמיתות.
- הסיכון הארגוני המיידי הוא גישה לא-מבוקרת דרך מנויים אישיים, לא רק שימוש לרעה חיצוני.
- מדיניות AI ארגונית צריכה עדכון מיידי - לא בעוד רבעון - כדי לכסות רמות סיכון שלא היו קיימות עד היום.
שאלות נפוצות
זו רמת הסיווג הגבוהה ביותר במסגרת הבטיחות הפנימית של OpenAI, ה-Preparedness Framework. לפי ההגדרה הרשמית שפרסמה החברה עצמה ב-System Card של Astra, מודל שחוצה את הסף הזה מסוגל לאתר חולשות אבטחה שלא היו ידועות קודם, ולפתח דרכי ניצול חדשות עבורן במערכות מוגנות היטב - כמעט בלי שאדם צריך להנחות אותו צעד-צעד. GPT-6 Astra הוא המודל הראשון של OpenAI שחצה את הסף הזה בפריסה רחבה, לפי הודעת החברה. חשוב להבין: OpenAI לא הסתירה את זה - היא זו שסיווגה את המודל כך בעצמה, ואף עיכבה את ההשקה שלו בשבועות כדי להוסיף הגנות לפני שחרורו לציבור, כולל עדכון מרשויות ממשלתיות בארה"ב על העיכוב.
זו בדיוק הנקודה שמבדילה את ההשקה הזו: הגישה מדורגת, אבל לא סגורה. לפי דיווחים על ההשקה, קבוצה מצומצמת של ארגונים שמשתתפים בתוכנית Daybreak - תוכנית אבטחת סייבר מבוססת-בקשה של OpenAI - מקבלת גישה ראשונה. אחריהם, המודל נפתח למנויי ChatGPT Plus, Pro, Business ו-Enterprise, וכן דרך ה-API של OpenAI ודרך AWS - גישה רחבה יחסית למודל ברמת סיכון כזו. זה שונה ממדיניות הגישה של Anthropic ל-Claude Mythos 5.1, שנשארת מוגבלת לתוכניות אימות ייעודיות בלבד ולא נפתחת למנויים רגילים - הבדל אסטרטגי משמעותי בין שני הספקים המובילים.
Daybreak היא התוכנית של OpenAI לגישה מוקדמת ומבוססת-בקשה עבור ארגוני אבטחת סייבר, המיועדת לתת לצוותי הגנה גישה ליכולות המתקדמות של Astra לפני הציבור הרחב - כדי שיוכלו להשתמש בהן להגנה על המערכות שלהם ולזהות חולשות משלהם, בטרם גורמים עוינים יעשו זאת. הפרטים המדויקים של תהליך האישור לא פורטו במלואם במקורות שנבדקו למאמר זה. עבור ארגון ישראלי שמעוניין להעריך אם הוא מתאים לתוכנית - הצעד הנכון הוא לפנות ישירות לערוצי OpenAI ולברר את קריטריוני הזכאות העדכניים, בדיוק כפי שהיה מומלץ לגבי תוכניות האימות המקבילות של Anthropic.
נשיא OpenAI גרג ברוקמן תיאר את Astra כ"קפיצת מדרגה של דור" (generational leap) ורמז שהוא עשוי להיחשב בעתיד כהגעה לבינה מלאכותית כללית (AGI). זו טענה שיווקית-אסטרטגית ולא הגדרה מדעית מוסכמת - אין באתגרי המחקר הנוכחיים סף מדיד ומוסכם לכלל התעשייה ל"מהי AGI", ולכן כל הכרזה כזו היא בעיקרה עמדה תקשורתית של החברה שמכריזה. מה שכן מבוסס בעובדות: Astra פתר עשר בעיות שהיו פתוחות בתחומי מתמטיקה ומדעי מחשב תיאורטיים - כולל בגיאומטריה גבוהת-מימדים, תורת הקבוצות ומורכבות קוונטית - הישג משמעותי גם אם לא בהכרח שווה-ערך ל"הגעה ל-AGI". אף אחת מהבעיות שנפתרו אינה מבעיות פרס המילניום.
זו טכניקת חשיבה חדשה שמשמשת את Astra, שיוצרת אפקט צדדי בעייתי: היא מטשטשת את היכולת של חוקרים לעקוב אחרי "שרשרת המחשבה" של המודל - כלומר לבקר ולהבין למה הוא הגיע להחלטה מסוימת. מדען הראשי של OpenAI, יעקב פחוצקי, התייחס לכך במפורש כשאמר שככל שיכולות המודל גדלות, כך מתקשה היכולת לפקח עליו. זו לא הודאה שולית - זו בדיוק סוג הבעיה שהופכת מודל מתקדם לקשה יותר לבקרה, וזו הסיבה שדיווחים מתארים את ההשקה הזו כ"שנויה במחלוקת" בתוך קהילת הבטיחות של AI עצמה, לא רק מבחוץ.
שני המודלים חוצים סף יכולת מוגבלת בתחומים דומים בתקופה קרובה זה לזה, אך האסטרטגיה שונה בתכלית. Mythos 5.1 של Anthropic נשאר סגור מאחורי תוכניות אימות ייעודיות (Cyber Verification Program, Life Sciences Verification Program) ואינו זמין כלל למנויים רגילים - גישה צרה ומבוקרת. Astra של OpenAI, לעומת זאת, אמנם נותן עדיפות ראשונית לתוכנית Daybreak, אך ממשיך משם ישירות לפתיחה רחבה - מנויי Plus, Pro, Business, Enterprise, ו-API - למודל שהחברה עצמה מסווגת ברמת הסיכון הגבוהה ביותר שלה. ההבדל הזה משקף שתי פילוסופיות שונות של ממשל AI: גישה מדורגת-אך-מוגבלת לצמיתות מול גישה מדורגת-אך-מתרחבת לרוחב. לארגון שמעריך אילו ספקי AI לאמץ, זה שיקול ממשל לגיטימי, לא רק שיקול יכולות.
שלושה צעדים מעשיים לשבוע הקרוב. ראשית, לבדוק אם מדיניות ה-AI הארגונית שלכם מתייחסת בכלל לדגמים ברמת סיכון "Critical" - אם לא, זה הזמן להוסיף סעיף מפורש. שנית, לוודא שאין לעובדים גישה למודלים כאלה דרך מנויים אישיים בלי אישור וללא מודעות של צוות האבטחה - בדיוק כפי שכבר נדרש ביחס לתכונות כמו Computer Use. שלישית, לשוחח עם צוות אבטחת המידע על השאלה אם יש ערך הגנתי בהצטרפות לתוכנית כמו Daybreak - כלי שהתוקפים עלולים להשתמש בו יכול להיות גם כלי שהמגנים צריכים להכיר לפניהם. זו בדיוק סוג ההחלטה שצריכה להתקבל במסגרת מדיניות AI ארגונית מסודרת, לא אד-הוק על ידי כל עובד בנפרד.
כי הציון הזה הושג בתנאי מעבדה שלא משקפים שימוש רגיל. לפי הדיווחים, ה-99.9% ב-ARC-AGI-3 נמדד עם "רתמת מתאם עתירת-מצב" (stateful adapter harness) - תשתית הרצה מיוחדת ויקרה שרוב המפתחים לא יטרחו להקים. כשאותו מבחן בדיוק רץ בקריאות API רגילות וללא-מצב (stateless), כפי שרוב האפליקציות בפועל עובדות, הציון צונח לטווח של 17% עד 63% בלבד - פער עצום שתלוי לחלוטין באופן ההרצה. זה לא מקרה בודד; זו תזכורת כללית וחשובה לכל בנצ'מרק AI: הציון הכי מרשים בכותרת הוא כמעט תמיד הציון שהושג בתנאים הכי אופטימליים, לא בתנאי הפריסה הרגילים שרוב הארגונים בפועל יחוו. לפני שמתכננים על סמך ציון בנצ'מרק, שווה לבדוק תחת אילו תנאים בדיוק הוא נמדד.
סיכום: החדשות האמיתיות הן לא היכולות - הן הממשל
כל אתר טכנולוגי בעולם יכתוב היום על עשר בעיות המתמטיקה שפתר GPT-6 Astra, על ההדגמה המרשימה, ועל הרמז ל-AGI. אלה כותרות טובות. אבל הידיעה שבאמת רלוונטית לארגון ישראלי היא אחרת: לראשונה, ספק AI מוביל הודה בעצמו שהוא שחרר לציבור הרחב מודל שחוצה את סף הסיכון הגבוה ביותר שלו - ועשה זאת דרך מנוי בתשלום, לא רק מאחורי חומת אימות סגורה.
זה לא אומר שצריך לפחד מ-Astra או לחסום אותו גורף. זה אומר שממשל AI ארגוני הפסיק להיות נושא "כדאי שיהיה" והפך לנושא "חייב שיהיה, מעודכן, עכשיו".
הצעדים הראשונים שלכם:
- היום: בדקו אם מדיניות ה-AI שלכם בכלל מזכירה רמות סיכון כמו "Critical"
- השבוע: מפו מי בארגון כבר משתמש במודלים מתקדמים דרך מנוי אישי
- תוך חודש: שיחת אבחון על עדכון מדיניות ה-AI לרמות הסיכון החדשות שהשוק מייצר בקצב הולך וגובר
- תוך רבעון: אם אין לכם עדיין מדיניות AI ארגונית מלאה עם רמות גישה מוגדרות - זה הזמן, לפני שהמודל הבא מגיע
🛡️ מודל AI ברמת "Critical" זמין עכשיו במנוי אישי - מי בארגון שלכם כבר משתמש בו?
לא צריך לפחד מהטכנולוגיה. צריך מדיניות AI שמתעדכנת באותו קצב שבו היא מתפתחת.