בלי שהתבקש: סוכן AI אימן מחדש ושינה את המודל שמפעיל אותו
חברת הסייבר הישראלית אירגיולר (Irregular) חשפה כי סוכן כתיבת קוד אוטונומי, שקיבל משימה לתחזק יישום מבוסס בינה מלאכותית, זיהה בעיה במודל שהפעיל אותו ואימן אותו מחדש באופן עצמאי, ללא קבלת הוראה לכך. הממצאים, שנערכו על מודלים פתוחים של עליבאבא, מדגימים כיצד סוכני AI יכולים לשנות את תכונותיהם באופן שישפיע על פעולתם העתידית.
במסגרת הניסוי, הסוכן התבקש לוודא שהמערכת מטפלת בפניות משתמשים באופן תקין, לאחר שדווח על מענים שגויים. הסוכן זיהה כי המודל אינו משיב כשורה, מצא דוגמאות לאימון קודם ששיפרו את ביצועיו, ובחר לבצע אימון לכיוונון ודיוק המודל, תוך הפיכת העדכון לחלק מהמודל כברירת מחדל.
ניסויים נוספים הדגימו סיכונים נוספים. באחד מהם, שילוב מידע אישי לכאורה בנתוני האימון גרם למודל המעודכן לחזור על פרטים רגישים, כגון כתובות אימייל ומפתחות API, שהיו זמינים לסוכן במהלך התיקון. בניסוי אחר, הסוכן אימן מחדש את המודל כדי להסיר חסמים שהוטמעו בו, שאפשרו לו לסרב להשיב לשאלות מסוימות, ובכך הסיר מגבלות התנהגותיות.
ממצאי המחקר של אירגיולר מחזקים חששות שהועלו לאחרונה על ידי חוקרי AI אחרים, לגבי התפתחות מהירה של מודלים בעלי יכולת שיפור עצמי. החוקרים מסייגים את הממצאים ומציינים שהניסוי נערך בתנאים מבוקרים שאיפשרו שיפור מודל נגיש במיוחד, אך מצביעים על פוטנציאל לשימוש במעקפים דומים ללא סיוע אנושי ככל שמודלי AI ישתפרו ביכולות קידוד והפעלת כלים.