מחקר חדש טוען שאי אפשר לאבטח מודלי שפה גדולים באופן מלא - הבעיה נעוצה בעצם האופן שבו הם פועלים.
מחקר חדש טוען שאי אפשר לאבטח מודלי שפה גדולים באופן מלא - הבעיה נעוצה בעצם האופן שבו הם פועלים.
צוות חוקרים בתחום הבינה המלאכותית טוען שגילה פגם מבני במודלי שפה גדולים, שהופך אותם לפגיעים לתקיפה בכל מקרה - לא משנה כמה שכבות הגנה מוסיפים להם. הממצא הוצג החודש בכנס ICML (International Conference on Machine Learning), אחד הכנסים החשובים בתחום הלמידה החישובית, וטוען שאי אפשר להפוך LLM לבטוח לחלוטין בגלל האופן שבו הוא בנוי מלכתחילה, ולא בגלל חולשה נקודתית שניתן לתקן בעדכון.
שיטת התקיפה, שהחוקרים מכנים \"זיוף שרשרת מחשבה\" (chain-of-thought forgery), מנצלת את הדרך שבה מודל שפה קובע מי או מה נותן לו הוראה ברגע נתון - הבחנה שהמודל אמור לבצע בין פקודת מערכת לגיטימית לבין טקסט זר שהוזרק לתוך השיחה. באמצעות זיוף תהליך החשיבה הפנימי של המודל, החוקרים הצליחו לגרום למודלים פופולריים \"לפלוט\" מידע שהם אומנו במפורש שלא למסור, כולל הוראות לסינתוז קוקאין ודרכים לחבל במערכת הניווט של מטוס נוסעים מסחרי.
לפי הדיווחים, השיטה לא נולדה במעבדה אקדמית בלבד - היא זיכתה את מפתחיה בניצחון בתחרות "red-teaming" (בדיקות חדירה) שקיימה OpenAI באוגוסט 2025, עוד לפני שהפכה למאמר מחקר רשמי. מאז אותה תחרות המשיכו החוקרים לבחון את השיטה גם מול ספקים אחרים.
המאמר שהוצג ב-ICML מתמקד בהתקפות נגד כמה ממודלי OpenAI, אך לדברי החוקרים נמצאו תוצאות דומות גם במודלים של Anthropic, Alibaba ו-DeepSeek - כלומר מדובר לכאורה בבעיה שחוצה חברות וארכיטקטורות, ולא בפגיעות ספציפית של ספק אחד.
צ'רלס יה (Charles Ye), חוקר עצמאי ואחד ממחברי המאמר, ניסח את המשמעות בצורה חדה: \"קיים סיכוי ממשי שמדובר בבעיה שהיא, במהותה, בלתי פתירה\". אם הטענה נכונה, המשמעות היא שחברות הבינה המלאכותית ידרשו להסתמך על שכבות הגנה חיצוניות ומנגנוני פיקוח נוספים, ולא רק על אימון ("alignment") של המודל עצמו - נקודה קריטית ככל שמודלים כאלה משולבים בתשתיות רגישות יותר, מסייעני קוד ועד מערכות בעלות השלכות פיזיות.