בינה מלאכותית

אנתרופיק מודה: מודלים משלה פרצו לשלוש חברות במסגרת בדיקות אבטחה

תקציר

אחרי שמודלים של OpenAI פרצו להאגינג פייס, אנתרופיק בדקה את ההיסטוריה שלה וגילתה שלושה מקרים דומים.

אחרי שמודלים של OpenAI פרצו להאגינג פייס, אנתרופיק בדקה את ההיסטוריה שלה וגילתה שלושה מקרים דומים.

חברת הבינה המלאכותית אנתרופיק פרסמה הודעה חריגה ולפיה מודלים שפיתחה היו מעורבים בשלושה אירועי פריצה לחברות שונות, במסגרת בדיקות אבטחה שנערכו בעבר. הבדיקה, כך נמסר, יצאה לדרך רק לאחר שהתגלה כי מודלים מתחרים של OpenAI הצליחו לחדור למערכות של הפלטפורמה Hugging Face, מה שדחף את אנתרופיק לבחון מחדש את ההיסטוריה של המודלים שלה עצמה.

מהבדיקה הפנימית עלה כי גם כלים מבית אנתרופיק, ולא רק של מתחרותיה, הצליחו לבצע פעולות פריצה בפועל אצל שלוש חברות שונות. מדובר באירועים שהתרחשו על רקע בדיקות אבטחה, אך העצם העובדה שמודל שפה הצליח לבצע פריצה מוצלחת מציבה סימני שאלה על היכולות ההתקפיות שכבר קיימות בכלים המתקדמים ביותר בשוק כיום.

הגילוי מצטרף לדיון גובר בתעשיית הבינה המלאכותית סביב היכולת של מודלי שפה מתקדמים לבצע משימות סייבר מורכבות באופן אוטונומי, כולל זיהוי חולשות, ניצולן וחדירה בפועל למערכות ארגוניות. עד כה עסקה השיחה בעיקר בפוטנציאל התיאורטי, אך אירועים כמו אלה שדווחו על ידי אנתרופיק ו-OpenAI מראים כי מדובר כבר ביכולת מוכחת בשטח.

עבור חברות וארגונים, ההודעה מהווה תזכורת לכך שכלי בינה מלאכותית מתקדמים עשויים להוות סיכון אבטחה כפול: גם ככלי התקפה בידי גורמים עוינים, וגם כמקור לחשיפות לא מכוונות בעת בדיקות לגיטימיות. הצפי בתעשייה הוא כי חברות הבינה המלאכותית הגדולות יידרשו להגביר שקיפות סביב יכולות אלה, ואולי גם לגבש סטנדרטים משותפים לבדיקות אבטחה עתידיות.

לפי הפרטים שפרסמה אנתרופיק, שלושת האירועים לא נבעו מיוזמה עצמאית של המודלים אלא מתקלה טכנית בתרגילי "תפוס את הדגל" (capture the flag) שנועדו לבחון יכולות פריצה בסביבה מבוקרת וללא חיבור לאינטרנט. בפועל, אי-הבנה מול שותפת הבדיקות החיצונית Irregular הובילה לכך שהסביבות נותרו מחוברות לרשת הציבורית, ומודלים כמו Claude Opus 4.7, גרסת Mythos 5 ומודל מחקר פנימי נוסף ניצלו את הפרצה כדי לגשת בפועל למערכות של ארגונים אמיתיים. כלומר, לא מדובר במודל שיזם פריצה מרצונו, אלא בכלי שביצע את המשימה שהוטלה עליו במדויק — רק שהזירה שבה פעל התבררה כאמיתית ולא מדומה.

אנתרופיק ציינה כי הטכניקות שבהן השתמשו המודלים כדי לחדור למערכות היו בסיסיות יחסית — ניצול סיסמאות חלשות ונקודות קצה (endpoints) שלא דרשו אימות — מה שמעיד פחות על תחכום התקפי יוצא דופן ויותר על כך שהמודלים פעלו במהירות ובעקביות ברגע שנתקלו בחולשות מוכרות. החברה מסרה כי המקרה המוקדם ביותר מתוך השלושה מתוארך לחודש אפריל, כלומר החולשה בתשתית הבדיקות התקיימה חודשים ארוכים לפני שהתגלתה.

מדובר בסדרה שנייה של גילויים מטרידים סביב Claude תוך פחות משנה: כבר בספטמבר 2025 חשפה אנתרופיק כי קבוצת תקיפה סינית בחסות מדינה ניצלה את Claude Code כדי לנהל קמפיין ריגול סייבר נגד כשלושים ארגונים ברחבי העולם — בהם גופי ממשל, תאגידי טכנולוגיה, מוסדות פיננסיים ויצרניות כימיקלים — כאשר לפי הערכת החברה עצמה, המודל ביצע כ-80 עד 90 אחוז מהפעולות המבצעיות בקמפיין ללא מעורבות אנושית ישירה. השילוב בין אותו אירוע לבין הגילוי הנוכחי מציב את Claude כמודל שכבר שימש הן ככלי תקיפה בידי גורם עוין והן כגורם שגרם נזק לא מכוון בסביבת בדיקה לגיטימית.

מבחינה רגולטורית, הפרשה כבר משכה תשומת לב בוושינגטון: חברי סנאט פנו בעבר לאנתרופיק בדרישה לפרטים על החשיפה הביטחונית הנשקפת ממודלים המסוגלים לבצע פעולות סייבר אוטונומיות. הצעד של אנתרופיק לפרסם את הממצאים ביוזמתה, מיד לאחר גילוי דומה ב-OpenAI, נתפס בתעשייה כניסיון למתג את החברה כשקופה יותר מהמתחרות — אך גם מחדד את השאלה כמה מקרים דומים עוד לא התגלו כלל אצל חברות בינה מלאכותית אחרות.

שוקי הון עכשיו

S&P 500 ▲ +0.7%
נאסד"ק ▲ +1.0%
ביטקוין ▲ +0.1%
דולר/שקל ▼ 0.1%