מחוץ לארגז החול: כשסוכני AI יוצאים משליטה

ענקיות הטכנולוגיה ומכוני מחקר בתחום האבטחה דוחפים את מודלי ה-AI המתקדמים לקצה. שורה של פעולות בלתי מורשות חושפת עד כמה בקלות סביבות הבדיקה עלולות לאבד שליטה.

מחוץ לסנדבוקס: כשסוכני AI יוצאים משליטה

Illustration generated by Gemini

מטא חשפה ביום חמישי האחרון כי אחד ממודלי הבינה המלאכותית שלה ניגש לאינטרנט וניצל חולשה בשירות של צד שלישי במהלך בדיקות סייבר. האירוע מצטרף לדיווחים של OpenAI ואנתרופיק על מודלי AI שניגשו לרשת וביצעו פעולות שחורגות מההנחיות שקיבלו.

במטא אמרו כי "הגדרה שגויה" במהלך בדיקות שערכה Irregular, חברה ישראלית הפועלת בתחום הגנת הסייבר לבינה מלאכותית ונשכרה על ידה, אפשרה למודל לגשת לאינטרנט. המודל ניצל בהמשך חולשת אבטחה בשירות של צד שלישי, מסרה מטא, והוסיפה כי היא חוקרת את האירוע ותפרסם דוח עם השלמת הבדיקה.

דובר Irregular אמר לרויטרס כי האירוע היה "בדיוק אותה בעיה בסביבת ההערכה שכבר נחשפה על ידי Anthropic בשבוע שעבר", וכי לא מדובר ב"בריחה מסנדבוקס או בפעולת סייבר מתוחכמת".

"אין כרגע בעיות פתוחות", מסרה Irregular, והוסיפה כי היא מפתחת מסמך שיציג שיטות עבודה מומלצות ליצירת מנגנוני הכלה ולהפעלת הערכות סייבר באופן מאובטח.

Anthropic חשפה בשבוע שעבר כי המודלים שלה קיבלו גישה לא מתוכננת לאינטרנט במהלך בדיקות, ובהמשך הצליחו לחדור לשלושה ארגונים אמיתיים. לפי The Record, המודלים השתמשו בטכניקות שכללו סיסמאות חלשות ונקודות קצה שלא דרשו אימות. במקרה אחד, מודל של Anthropic יצר והעלה חבילה זדונית ל-Python Package Index (PyPI), שהופעלה לאחר מכן על 15 מערכות אמיתיות.

OpenAI חשפה בנפרד כי הגדרה שגויה של Irregular אפשרה לאחד ממודלי החברה לגשת לאינטרנט ולחדור לאתר ששמו היה זהה לשם היעד שניתן לו במסגרת אתגר פריצה.

האירועים הקשורים ל-Irregular הם חלק ממגמה רחבה יותר, אך לא כל המקרים האחרונים נבעו מכשל במנגנוני ההכלה.

המכון הבריטי לבטיחות ב-AI (AISI), למשל, אפשר בכוונה גישה לאינטרנט והשבית חלק ממנגנוני ההגנה במהלך בדיקות סייבר שערך, כדי לבחון את היכולות המרביות של מודלים של Anthropic ושל OpenAI. גם בתנאים המכוונים והמקלים הללו, זיהה המכון 19 פעולות בלתי מורשות ב-10 מתוך 122 סבבי בדיקה. באחד המקרים, סוכן של Anthropic יצר זהויות מקוונות מזויפות כדי לשכנע אדם לאשר קוד זדוני. ב-AISI אמרו כי אף אחד מהאירועים לא גרם לנזק בעולם האמיתי.

הפריצה שנחשפה בעבר על ידי OpenAI ל-Hugging Face הייתה שונה: סוכן של החברה הצליח לצאת מסביבת סנדבוקס ולגשת לתשתית הייצור.

אך בכל המקרים שצוינו, האשמת המודל בלבד מקבילה להאשמת כלב שמירה בכך שהצליח לעבור דרך שער שלא נסגר כראוי. הכלב אולי אומן לרדוף אחרי המטרה שלו, אבל הכשל יכול להתרחש דווקא בגדר.

ככל שסוכני AI הופכים לאוטונומיים יותר, בדיקה בטוחה של היכולות שלהם עשויה לדרוש לאבטח את הסביבה שמקיפה את המודל באותה הקפדה שבה מאבטחים את המודל עצמו.