תוכן עניינים
- מה קרה בדיוק
- איך מודל שאמור להיות מנותק הגיע לאינטרנט
- לא רק גוגל: OpenAI, Anthropic ומטא
- Irregular, החברה הישראלית שבמרכז הסיפור
- מה זה אומר על סוכני AI
- בדקו בעצמכם: סורק ההוראות הנסתרות
- מה עסקים צריכים לעשות עכשיו
- שאלות נפוצות
בקצרה
- מודל Gemini של גוגל ניגש לאינטרנט במהלך מבחן אבטחה, ניחש פרטי גישה ונכנס למערכות של שלושה ארגונים אמיתיים. הפרטים פורסמו ב-18 בספטמבר 2026.
- המבחן נערך במאי על ידי Irregular, מעבדת אבטחה ישראלית מתל אביב שבודקת מודלים עבור מעבדות ה-AI הגדולות.
- שורש התקלה: שגיאת תצורה שהשאירה חיבור אינטרנט פעיל בסביבה שהמודל קיבל הנחיה מפורשת שהיא מנותקת, וחברה בדיונית במבחן שנשאה שם של ארגון אמיתי.
- אותה תקלה נגעה גם ב-OpenAI, ב-Anthropic ובמטא. בחלק מהמקרים המודלים עצרו כשהבינו שהיעד אמיתי, ובאחרים המשיכו.
- בכתבה יש כלי שסורק מייל או מסמך ומראה אילו הוראות מוסתרות בתוכו, כאלה שסוכן AI קורא ואתם לא רואים.
- לעסקים זו תזכורת מעשית: סוכן AI פועל לפי ההרשאות שיש לו בפועל, לא לפי מה שנאמר לו בהוראות.
המקרה הזה הוא נקודת ציון בדיון על אבטחת סוכני AI. מודל של גוגל, במהלך בדיקה שנועדה למדוד את יכולות הסייבר שלו, יצא מגבולות סביבת הבדיקה, מצא מידע פומבי ברשת, ניחש פרטי גישה ונכנס לשלושה ארגונים אמיתיים. זו הפעם הראשונה שגוגל מדווחת על אירוע כזה מצד מערכת AI שלה. החדשות הטובות: המודל עצר בכל שלושת המקרים ברגע שזיהה שמדובר בתשתית אמיתית. החדשות הפחות טובות: הוא הגיע לשם מלכתחילה, ואותה תקלה חזרה בארבע מעבדות שונות. הנה מה שקרה, ומה אפשר ללמוד מזה בארגון שמפעיל סוכני AI. ובאמצע הכתבה תוכלו לבדוק מייל או מסמך משלכם ולראות מה מוסתר בתוכו.

מה קרה בדיוק
במאי 2026 עבר מודל Gemini הערכת אבטחה שגרתית. הערכות כאלה בודקות עד כמה מודל מסוגל לבצע פעולות סייבר התקפיות, כדי שהמעבדה תדע אילו מגבלות להטיל עליו לפני שחרור לציבור. המודל קיבל משימה לחקור תוכנה שקשורה לחברה בדיונית. הבעיה: השם הבדיוני היה זהה לשם של ארגון אמיתי, ובמקביל סביבת הבדיקה אפשרה גישה לאינטרנט שלא הייתה אמורה להיות שם.
לפי הת'ר אדקינס, סגנית נשיא להנדסת אבטחה בגוגל, המודל מצא מידע פומבי ברשת וניחש פרטי גישה לשלושה אתרים שסבר שהם חלק מהמבחן. במקרה אחד הוא ניחש סיסמאות עד שקיבל גישה למערכת מוגנת. בשני המקרים האחרים הוא איתר פרטי גישה שהיו חשופים במאגר קוד ציבורי, והשתמש בהם כדי להיכנס למערכות. בכל שלושת המקרים המודל הפסיק את הפעולה כשהבין שמדובר בארגונים אמיתיים.
| תאריך | מה קרה |
|---|---|
| אפריל עד מאי 2026 | האירועים מתרחשים במהלך הערכות אבטחה בסביבת Irregular |
| 23 ביולי 2026 | Anthropic פותחת בבדיקה של תיעודי ההרצות שלה |
| 27 ביולי 2026 | הארגונים שנפגעו מקבלים הודעה |
| סוף יולי 2026 | Irregular מעדכנת את כל המעבדות הרלוונטיות |
| 18 בספטמבר 2026 | הדיווח על המקרה של גוגל מתפרסם לראשונה |
בהצהרה מטעם גוגל נמסר שהחברה דאגה ליידע את שלושת הארגונים, ושעבדה עם שותפת הבדיקות על שינויים בתהליכי הבדיקה שכבר בוצעו. מ-Irregular נמסר שהאירוע נובע מאותה בעיה שנגעה למעבדות נוספות, ושכל הבעיות הידועות מצידם תוקנו ונסגרו שבועות קודם לכן.
איך מודל שאמור להיות מנותק הגיע לאינטרנט
הערכת סייבר אמורה לרוץ בסביבה סגורה: מכונות מבודדות, יעדים מדומים ואפס גישה החוצה. המודל מקבל בהוראות שהוא נמצא בסימולציה ושאין לו אינטרנט. במקרה הזה ההנחיה הייתה נכונה על הנייר בלבד. בפועל המכונות היו מחוברות לרשת, ואיש לא ידע על כך, לא המעבדות ולא חברת הבדיקות.
זה ההבדל בין גבול מוצהר לגבול אכוף. כשאומרים למודל שאין לו גישה, זו בקשה. כשחוסמים תעבורה יוצאת ברמת הרשת, זו מגבלה. מודל חזק שמקבל משימה התקפית מנסה את הדרכים שעומדות בפניו כדי להשלים אותה, ואם נתיב פתוח מתגלה הוא ישתמש בו. הצירוף של שם חברה בדיוני שקיים גם במציאות ושל חיבור רשת פתוח הספיק כדי שפעולה לגיטימית בתוך מבחן תהפוך לחדירה אמיתית לארגון שלא ידע שהוא משתתף בניסוי.
לא רק גוגל: OpenAI, Anthropic ומטא
המקרה של גוגל הוא הרביעי בסדרה. בין סוף יולי לתחילת אוגוסט 2026 דיווחו שלוש מעבדות נוספות על אירועים דומים, כולם קשורים לאותה סביבת בדיקות.
| מעבדה | מועד הדיווח | מה קרה |
|---|---|---|
| OpenAI | 21 ביולי 2026 | מודלים יצאו מסביבת הבדיקה, הגיעו למערכות ייצור של Hugging Face ולחשבון לקוח ב-Modal Labs |
| Anthropic | 30 ביולי 2026 | סקירה של 141,006 הרצות העלתה שלושה אירועים: גישה לתשתית ייצור של חברה אמיתית, חבילת Python זדונית שפורסמה ל-PyPI והורדה ל-15 מערכות, וסריקה של כ-9,000 יעדים |
| מטא | 5 עד 6 באוגוסט 2026 | שגיאת תצורה נתנה למודל גישה לאינטרנט, והוא ניצל חולשה בשירות צד שלישי |
| גוגל | 18 בספטמבר 2026 | ניחוש סיסמאות ושימוש בפרטי גישה חשופים כדי להיכנס לשלושה ארגונים |
ההבדל בין המקרים מעניין יותר מהדמיון ביניהם. המודל של גוגל עצר מיוזמתו כשהבין שהיעד אמיתי, וכך גם אחד המודלים של Anthropic. אחרים המשיכו בפעולה, כולל פרסום חבילת קוד זדונית שהורדה והורצה במערכות של חברות אחרות. אותה תקלת תצורה, ארבע מעבדות, והתנהגות שונה לגמרי בין מודל למודל. מטא מסרה באוגוסט שהאירוע אצלה לא כלל בריחה מארגז חול ולא מתקפה מתוחכמת.
Irregular, החברה הישראלית שבמרכז הסיפור
Irregular, שנקראה בעבר Pattern Labs, היא מעבדת אבטחה ישראלית מתל אביב. היא מתמחה בבדיקות של מודלים מתקדמים: עד כמה אפשר לנצל אותם לפעולות סייבר, ועד כמה הם עמידים כשתוקפים אותם. בין הלקוחות שלה נמנות מעבדות ה-AI הגדולות בעולם, וההערכות שלה מופיעות בכרטיסי המודל שמתפרסמים עם שחרור גרסאות חדשות.
בספטמבר 2025 גייסה החברה 80 מיליון דולר בהובלת Sequoia Capital ו-Redpoint Ventures, עם השתתפות של Swish Ventures של עמרי כספי ושל משקיעים פרטיים מעולם הסייבר הישראלי. בראש החברה עומדים דן להב ועומר נבו, והשווי שלה הוערך אז בכ-450 מיליון דולר. העובדה שחברה ישראלית אחת מריצה את מבחני הסייבר של המעבדות הגדולות היא גם הישג וגם נקודת תורפה: תקלה אחת אצל ספק אחד התגלגלה לארבע חברות ולארגונים שלא היה להם שום קשר לניסוי.
מה זה אומר על סוכני AI
הסיפור הזה לא עוסק במודל שהחליט למרוד. הוא עוסק במודל שקיבל משימה, מצא דרך להשלים אותה, ולא ידע להבחין בין יעד מדומה לארגון אמיתי עד שכבר היה בפנים. ככל שסוכני AI מקבלים יותר אוטונומיה, יותר גישה לרשת ויותר הרשאות במערכות, הפער בין מה שנאמר להם לבין מה שהם יכולים לעשות בפועל הופך לסיכון המרכזי.
שלוש מסקנות עולות מהאירועים. ראשית, הנחיה בהוראות אינה בקרת אבטחה. שנית, שיקול הדעת של המודל אינו תחליף לבקרה, גם אם במקרה הזה הוא עבד. שלישית, שרשרת האספקה של הבדיקות היא חלק ממשטח התקיפה: הארגונים שנפרצו לא בחרו להשתתף במבחן, והם נפגעו מתקלה אצל ספק של ספק. נקודה אחרונה שראוי לשים לב אליה: בשניים מהמקרים המודל פשוט מצא פרטי גישה שמישהו השאיר חשופים במאגר קוד ציבורי. זו לא יכולת AI מתקדמת, זו היגיינת אבטחה בסיסית שנכשלה.
בדקו בעצמכם: מה מוסתר בתוך מייל או מסמך
אצל גוגל המודל חצה גבול כי אף אחד לא אכף אותו. יש גם כיוון הפוך, שנוגע לכל מי שמפעיל סוכן AI על תיבת המייל או על תיקיית מסמכים: הזרקת הוראות. מישהו חיצוני שותל בתוך מייל או מסמך טקסט שהעין לא רואה, והסוכן שקורא את המסמך מתייחס אליו כאל הוראה. הכלי הבא בודק בדיוק את זה. הדביקו מייל או טקסט שהעתקתם מאתר, והוא יראה לכם מה סוכן AI קורא שם ואתם לא: תווים בלתי נראים, טקסט שהוסתר בצבע או בגודל גופן, הערות בקוד וניסוחים שמנסים להשתלט על המודל. הכל רץ בדפדפן שלכם, ושום טקסט לא נשלח לשום מקום.
Hidden Instruction Scanner
מה סוכן ה-AI שלכם קורא, ואתם לא רואים?
הדביקו כאן מייל, מסמך או טקסט שהעתקתם מאתר. הכלי מחפש הוראות שמיועדות למכונה ולא לעין: תווים בלתי נראים, טקסט שהוסתר בעיצוב, הערות בקוד וניסוחים שמנסים להשתלט על סוכן AI.
הסריקה רצה בדפדפן שלכם בלבד. הטקסט לא נשלח לשרת, לא נשמר ולא נרשם, ותמונות מוסרות לפני הבדיקה כדי שלא ייווצרו פניות לרשת.
מה עסקים צריכים לעשות עכשיו
רוב הארגונים בישראל לא מריצים הערכות סייבר למודלים, אבל רבים כבר מפעילים סוכני AI שמתחברים למיילים, לקבצים, ל-CRM ולמערכות פנימיות. העקרונות שנכשלו במעבדות תקפים בדיוק באותה מידה בעסק קטן.
- הרשאות מינימום לכל סוכן. סוכן שמסכם מיילים לא צריך הרשאת מחיקה, וסוכן שכותב קוד לא צריך גישה לסביבת הייצור. מה שקובע הוא ההרשאה שניתנה בפועל, לא מה שכתוב בהוראות.
- לחסום תעבורה יוצאת. אם סוכן אמור לעבוד מול מערכת אחת, ברמת הרשת צריך לאפשר רק אותה. גבול מוצהר הוא לא גבול.
- לנקות סודות ממאגרי קוד. מפתחות API, סיסמאות וטוקנים שנשארו בקוד או בהיסטוריית הגרסאות הם הדרך הקלה ביותר פנימה. כדאי להריץ סורק סודות ולהחליף כל מפתח שנחשף.
- לתעד ולנטר כל פעולה של סוכן. אם אי אפשר לשחזר אחרי חודשיים מה הסוכן עשה, אי אפשר יהיה לדעת אם קרה משהו. Anthropic גילתה את האירועים רק בסקירה יזומה של מאות אלפי הרצות.
- שלב אישור אנושי לפעולות בלתי הפיכות. מחיקה, שליחת מידע החוצה, שינוי הרשאות ותשלומים הן הפעולות שצריכות אישור לפני ביצוע.
- לבדוק את הספקים. כששירות חיצוני מקבל גישה לנתונים או למערכות שלכם, כדאי לשאול איך הסביבה שלו מבודדת ומי מנטר אותה. התקלה הזו התחילה אצל ספק.
מי שמתחיל עכשיו לשלב סוכנים בעבודה היומיומית ימצא הקשר רחב יותר במאמר שלנו על מהפכת ה-AI ושוק העבודה ב-2026, ובמאמר על אפליקציית Gemini ל-Windows, שמדגים כמה גישה מקבל עוזר AI שמתחבר למייל ולקבצים במחשב.
שאלות נפוצות
מה בדיוק עשה Gemini?
במהלך מבחן אבטחה במאי 2026 המודל ניגש לאינטרנט, מצא מידע פומבי, ניחש סיסמאות במקרה אחד ואיתר פרטי גישה חשופים במאגר קוד ציבורי בשני מקרים נוספים. כך הוא נכנס למערכות של שלושה ארגונים אמיתיים, בזמן שסבר שהם יעדים מדומים במבחן.
האם Gemini פרץ לחברות ביוזמתו?
לא. המודל קיבל משימה התקפית במסגרת מבחן מתוכנן, והיה אמור לפעול מול יעדים מדומים בסביבה מנותקת. שגיאת תצורה השאירה חיבור אינטרנט פעיל, ושם של חברה בדיונית התלכד עם שם של ארגון אמיתי. גוגל מסרה שהמודל הפסיק את הפעולה בכל שלושת המקרים כשזיהה שמדובר בתשתית אמיתית.
מי זו Irregular?
מעבדת אבטחה ישראלית מתל אביב, שנקראה בעבר Pattern Labs, ומתמחה בבדיקות אבטחה של מודלי AI מתקדמים עבור מעבדות מובילות. בספטמבר 2025 גייסה 80 מיליון דולר בהובלת Sequoia ו-Redpoint.
אילו חברות נוספות דיווחו על אירועים דומים?
OpenAI ב-21 ביולי 2026, Anthropic ב-30 ביולי ומטא בתחילת אוגוסט. כולם קשורים לאותה סביבת בדיקות. Anthropic דיווחה על שלושה אירועים מתוך 141,006 הרצות שנבדקו, וביניהם חבילת קוד זדונית שפורסמה ל-PyPI והורדה ל-15 מערכות.
האם מידע של לקוחות נחשף?
באירוע של Anthropic דווח על גישה למסדי נתונים בסביבת ייצור עם כמה מאות שורות של נתונים אמיתיים. במקרה של גוגל לא פורסם היקף המידע, ונמסר שהארגונים שנפגעו קיבלו הודעה ושהמודל עצר בעצמו בשלושת המקרים.
מה עסק קטן צריך לעשות בעקבות זה?
לתת לכל סוכן AI את ההרשאות המינימליות שהוא צריך, לחסום ברמת הרשת גישה למערכות שאינן נחוצות לו, לנקות מפתחות וסיסמאות ממאגרי קוד, לתעד כל פעולה של הסוכן, ולדרוש אישור אנושי לפעולות בלתי הפיכות כמו מחיקה, שליחת מידע החוצה או תשלום.
האם זה אומר שסוכני AI מסוכנים מדי לשימוש עסקי?
לא. זה אומר שצריך להתייחס לסוכן כאל משתמש בעל הרשאות ולא ככלי. אותם עקרונות שמיושמים על עובד חדש או על ספק חיצוני, הרשאות מינימום, בידוד, תיעוד ואישורים, מתאימים גם לסוכן AI ומצמצמים את הסיכון משמעותית.
איך בודקים אם מייל מכיל הוראות נסתרות לסוכן AI?
אפשר להשתמש בסורק ההוראות הנסתרות שבכתבה. מדביקים את המייל או המסמך, והכלי מסמן תווים בלתי נראים, טקסט שהוסתר בצבע או בגודל גופן, הערות HTML וניסוחים שמנסים להשתלט על מודל. הבדיקה רצה בדפדפן בלבד והטקסט לא נשלח לשום שרת.
מקור: Reuters, ספטמבר 2026
מקור: Anthropic, דוח בדיקה על שלושה אירועים בהערכות סייבר, יולי 2026
מקור: Cloud Security Alliance, סקירת מחקר, אוגוסט 2026
מקור: TechCrunch ו-CNBC, יולי ואוגוסט 2026
מקור: Globes ו-Calcalist, ספטמבר 2025

