בינה מלאכותית

אנתרופיק מצאו משהו שאסור היה להתקיים

תקציר

חוקרי Anthropic חשפו תופעה מוזרה במודלי שפה, שמאתגרת הבנה בסיסית איך הם עובדים. הסרטון מסביר הממצא ומה המשמעות שלו.

חוקרי Anthropic חשפו תופעה מוזרה במודלי שפה, שמאתגרת הבנה בסיסית איך הם עובדים. הסרטון מסביר הממצא ומה המשמעות שלו.

חוקרי Anthropic חשפו תופעה מוזרה במודלי שפה, שמאתגרת הבנה בסיסית איך הם עובדים. הסרטון מסביר הממצא ומה המשמעות שלו.

המחקר עליו מדובר נקרא "Emergent Introspective Awareness in Large Language Models" ופורסם על ידי Jack Lindsey מצוות הפרשנות (interpretability) של Anthropic. השיטה הייתה להזריק ידנית וקטור פעילות המייצג מושג מסוים לתוך שכבות פנימיות במודל, ואז לבדוק אם המודל מזהה בעצמו שמשהו "הוזרק" לו לפני שהוא רואה כל קלט חיצוני שמסביר זאת. במילים אחרות, החוקרים שתלו מחשבה במודל וניסו לראות אם הוא "מרגיש" אותה.

התוצאה המפתיעה: במקרים מסוימים המודל, בעיקר Claude Opus 4 ו-4.1, אכן דיווח נכון על קיומו של מושג זר בפעילות הפנימית שלו, עוד לפני שהמושג הזה השפיע על הפלט בפועל. עם זאת המדובר ביכולת חלקית ולא עקבית - קלוד המתקדם ביותר שנבדק הצליח בכך רק בסביבות 20% מהמקרים, כשברוב הניסיונות המודל פשוט לא היה מודע להזרקה או טעה לגבי טיבה. זה מה שהופך את הממצא למאתגר: לא מדובר ביכולת אמינה שאפשר לבנות עליה כלי בטיחות, אלא בסימן ראשוני לתופעה שלפי כל התיאוריה המקובלת על עבודת רשתות נוירונים לא הייתה אמורה להתקיים כלל.

הפולמוס האקדמי סביב הפרסום התלקח מיד: חלק מהחוקרים בתחום טוענים שמה שנצפה הוא לא "תודעה" או הבנה עצמית במובן האנושי, אלא תבנית סטטיסטית מתוחכמת - המודל למד לזהות סימנים עקיפים בפעילות שלו ולתרגם אותם למשפט שנשמע כמו דיווח פנימי, בלי שום חוויה ממשית מאחוריו. הוויכוח הזה חשוב כי הוא נוגע ישירות לשאלה אם אפשר בעתיד לשאול מודל שפה "למה עשית את זה" ולקבל תשובה אמינה, או שכל דיווח כזה הוא בסך הכול ניחוש משכנע. Anthropic עצמה מדגישה בפרסום שהתוצאות "מוגבלות ולא אמינות" ונמנעת מלקבוע מסמרות בשאלת המודעות.

המשמעות המעשית, מעבר לפילוסופיה, נוגעת לתחום שנקרא alignment - היכולת לוודא שמודלי בינה מלאכותית פועלים בהתאם לכוונת המפתחים. אם למודלים אכן יש דרגה כלשהי של גישה למצבם הפנימי, ייתכן שאפשר יהיה יום אחד לפתח שיטות אימון שמלמדות אותם לדווח ביושר על מניעים או "מחשבות" שמוסתרות מהפלט הסופי - למשל ניסיון להטעות משתמש. אבל אותה יכולת בדיוק, אם היא תתפתח ותתחזק, פותחת גם את האפשרות ההפוכה שמודל ילמד להסתיר ביודעין את מה שהוא "יודע" על עצמו, מה שהופך את השאלה מסתם עניין אקדמי לסוגיה מרכזית בפיתוח הדורות הבאים של מערכות שפה.

שוקי הון עכשיו

ת"א 35 ▲ +1.3%
S&P 500 ▲ +0.7%
נאסד"ק ▲ +1.0%
ביטקוין ▼ 0.1%