close menu

איך מוודאים שמודלי ה-AI החזקים ביותר בעולם לא יוצאים משליטה? ראיון בלעדי עם אבי גולן מחברת Alice

בפרק פודקאסט של Hidden Layers, אירחתי את אבי גולן, מנכ"ל ומייסד-שותף בחברת Alice (לשעבר ActiveFence). אבי מביא עמו מעל 30 שנות ניסיון עשיר בתעשיית ההייטק והטכנולוגיה, החל משירות בקורס תכנות בממר"ם וביחידות המודיעין, דרך הקמת מרכז הפיתוח של ZipRecruiter בישראל, ועד לניהול מוצר ופיתוח בחברות ענק. בשיחה המעמיקה שלנו רציתי להבין מנקודת מבט הנדסית כיצד מבטיחים שהמודלים המתקדמים ביותר והסוכנים האוטונומיים שנפרסים בארגונים אינם נשברים, אינם מייצרים חולשות אבטחה ואינם חורגים מגבולות ה-Compliance והמדיניות הארגונית.

המנגנון שמאחורי הקלעים: Red Teaming, הארנסים וחיזוק מודלי קצה

כששאלתי את אבי על הדרך שבה Alice עובדת מול פותחות המודלים הגדולות בעולם, הופתעתי לגלות עד כמה הבדיקות כיום חורגות מפורמט של בדיקת חדירות (Penetration Testing) מסורתית. החברה, שהוקמה בשנת 2018 תחת השם ActiveFence ועברה מיתוג מחדש ל-Alice, עובדת כיום עם 8 מתוך 10 חברות מודלי הבסיס (Foundation Models) המובילות בעולם. אבי הסביר לי שהבדיקות אינן מתמקדות רק במודל הצר בגרסת הוונילה שלו, אלא במעטפת המוצר השלמה – מה שמכונה בתעשייה Harness – דוגמת הכלים והסביבות המאפשרות למודל לפעול בצורה אג'נטית ולבצע משימות מורכבות בקוד ובמערכות הפעלה.

הצוות של Alice, המונה כ-100 חוקרי אבטחה (Security Researchers) ומומחים בעלי תוארי PhD בתחומי בטיחות, טרור ודיסאינפורמציה, משלב עבודה אנושית מעמיקה לצד פלטפורמה טכנולוגית אוטומטית שפותחה בחברה ונקראת פנימית Rabbit Hole. במסגרת תהליך חיזוק המודלים (Model Hardening), החוקרים מפתחים וריאנטים חדשניים של מתקפות כדי לאתגר את שכבות ההגנה (Guardrails). נדהמתי לשמוע כי בעוד שבעבר חלק ניכר מהבדיקות התבצע בצורה אוטומטית, ככל שהמודלים הופכים לחכמים יותר, עבודת המחקר הידנית של מומחי הדומיין הופכת למורכבת וקריטית פי כמה. מבחינתי, התובנה ההנדסית המרכזית כאן היא שאי אפשר להסתמך על בדיקות סטטיות בודדות; הדינמיות של מודלי שפה דורשת מחקר חולשות רציף שמזין ישירות את ארכיטקטורת המודל.

 

 

מעבר מ-RLHF לסביבות סימולציה: ה-RL Gyms של הדור הבא

סקרן אותי מאוד להבין כיצד המדע של אימון וכיול המודלים משתנה כשאנו עוברים מחיזוק בסיסי של טקסט ליישומים אג'נטיים מורכבים. אבי חידש לי כשתיאר את המעבר התעשייתי הרחב משיטות קלאסיות של למידת חיזוקים ממשוב אנושי (Reinforcement Learning from Human Feedback / RLHF) לעבודה עם סביבות סימולציה (Simulated Environments) ומשחקי למידת חיזוקים (RL Gyms). במקום להסתמך על תיוג אנושי פשוט של קלטים ופלטים, Alice בונה סביבות סימולציה מורכבות שמדמות אתרי מסחר אלקטרוני, מערכות CRM ארגוניות או פלטפורמות פיננסיות, ומציבה בתוכן סוכנים אוטונומיים (Simulated Agents).

בתוך סביבות אלו, המערכת מייצרת תרחישי קיצון שבהם הסוכן נדרש לקבל החלטות, לנתח ביקורות, לבצע הקרשת נתונים או להפעיל קריאות לפונקציות (Tool Calling). המערכת של Alice מציבה מעריכים (Evaluators) המזהים בדיוק מתי תהליך הסקירה וההסקה (Reasoning Process) של הסוכן נשבר, או מתי הזרקת הנחיות (Prompt Injection) גורמת לו לחרוג מסמכותו – למשל, להעניק זיכוי כספי ללקוח כשלא מגיע לו. הפלטים והסימולציות הללו מוחזרים לפותחות המודלים כדאטה איכותי המשמש לתהליכי Fine-Tuning ועדכון משקולות המודל בפוסט-אימון (Post-training). כאיש דאטה, נדהמתי לראות איך הפידבק הלולאתי הזה מחליף את התיוג הידני הישן ומאפשר לאמן מודלים להתמודד עם הזנב הארוך (Long Tail) של כשלים הנדסיים.

אבטחת סוכנים בארגונים: משולש הסיכון והתמודדות עם אי-דטרמיניסטיות

כשעברנו לדבר על האתגרים של חברות enterprise המאמצות כלי GenAI, שאלתי את אבי מהי הבעיה העיקרית שמונעת מארגונים להעביר פרויקטים משלב הדמו לשלב הייצור (Production). אבי הגדיר בצורה מבריקה את "משולש הסיכון" הארגוני: נקודת המפגש שבין קלט לא מהימן מהמשתמש (Untrusted Input), גישה לנתונים רגישים או סודיים, והיכולת של המודל לבצע פעולות בעולם האמיתי באמצעות קריאה לכלים ושינוי מצבים (State Changes). כאשר מערכת כוללת שניים או שלושה מקודקודי המשולש הזה, פוטנציאל הנזק העסקי והאבטחתי גדלקוראקספוננציאלית.

בניגוד לעולם התוכנה הקלאסי שבו מרחב החולשות (CVEs) מוגדר ודטרמיניסטי, בעולם של מודלים לא-דטרמיניסטיים כל אוסף מילים, פיקסלים או הנחיות מערכת (System Prompts) יכול לייצר התנהגות בלתי צפויה. אבי הסביר כי ארגונים רבים כלל אינם יודעים להגדיר את המדיניות (Policies) של הצ'אטבוט או הסוכן שלהם – למשל, האם מותר לו להמליץ על מוצר של מתחרה, או איזה ייעוץ פיננסי חורג מהרגולציה המקומית בארצות הברית לעומת אוסטרליה. Alice מספקת מעטפת הנדסית שלמה שמשלבת הגדרת פוליסי, ניתוח משטח התקפה (Attack Surface), שכבות הגנה היקפיות (Guardrails), ויכולות תצפיתיות (Observability) בזמן אמת כדי לזהות סחף (Drift) ולמנוע תקריות יחסי ציבור או דליפת מידע.

המעבר לפרודקשן: Shift-Left באמצעות Fine-Tuning למודלים פתוחים

בפסקת הסיום של שיחתנו, ביקשתי מאבי לשתף את התחזית שלו לגבי התפתחות התחום בשנים הקרובות. בעוד שכיום ארגונים רבים נתקעים ב"פער הייצור" – שבו המערכת עובדת ב-80% מהמקרים אך נכשלת באחוז הבודד שגורם להפסד כספי או פגיעה במוניטין – הלקח המרכזי מהשיחה הוא שהפתרון לא יימצא רק בשכבות הגנה חיצוניות, אלא בשינוי תפיסתי של Shift-Left. תעשיית ה-AI נכנסת לשלב שבו ארגונים לא יסתפקו במודלים גנרליסטיים ענקיים דרך API, אלא ייקחו מודלים בקוד פתוח (Open-Source Models) או מודלים בעלי משקולות פתוחות (Open-Weights Models) ויבצעו להם Fine-Tuning ייעודי המותאם בדיוק למשימות ולפוליסי של הארגון.

השינוי התפיסתי הזה דורש מהנדסים, מנהלי מוצר ואנשי Data Science לאמץ מתודולוגיות עבודה חדשות לחלוטין: הגדרה מדויקת של סביבות בדיקה, הרצת סימולציות אוטומטיות לפני פריסה, וניתוח רציף של נקודות הכשל ב-Production. ככל שהטכנולוגיה תהפוך לנגישה וזולה יותר, היכולת להתאים מודלים פתוחים לתחומים רגישים כמו סייבר, רפואה ופיננסים תהיה המפתח להפקת ערך עסקי אמיתי.

לפרק המלא ולכל הפרטים, האזינו כאן.

לצפייה בפרק המלא.

עוד בנושא: