איך מאמנים מאפס Foundation Model לוויזואל? ראיון בלעדי עם מישה פיינשטיין מחברת Bria

אירחתי את מישה פיינשטיין, ה-VP of R&D בחברת Bria, למפגש מעמיק על האתגרים ההנדסיים, האלגוריתמיים והאסטרטגיים בפיתוח מודלי בסיס (Foundation Models) מקצה לקצה. מישה, שמביא עמו ניסיון של מעל עשור בעולמות ה-Computer Vision וה-AI, הוביל ב-5 השנים האחרונות את ארכיטקטורת הליבה של Bria. בשיחה גילוי-לב, צללנו לשאלה איך חברה ישראלית בונה מודלי ג'נרציה לוויזואל מאפס (From Scratch), מתחרה בענקיות הטכנולוגיה העולמיות, ומפצחת את אתגרי הזכויות, השליטה הגרנולרית וההנדסה בפרודקשן.
1. אסטרטגיית הדאטה והמשולש הקדוש: Data, Compute ו-Architecture
כששאלתי את מישה מה באמת מניע אופרציה של אימון מודל בסיס מאפס, הופתעתי לגלות עד כמה המאמץ מתחלק באופן שווה בין תשתית, דאטה ואלגוריתמיקה. מישה הגדיר זאת כ"משולש" המורכב מגיוון דאטה אדיר, קלאסטרים עצומים של GPU, וארכיטקטורה אלגוריתמית ייעודית. נדהמתי לשמוע על אתגרי ה-Compute החמורים בתעשייה, שבהם קריסה חומרית קטנה של שרתי אינטרקונקט בקלאסטר עלולה להפיל אימון שלם.
ההיבט המרתק ביותר במודל של Bria טמון בגישת הדאטה: בשונה מחברות ענק שמבצעות Scraping לא מורשה באינטרנט, Bria מאמנת אך ורק על דאטה שהוא 100% Fully Licensed. במקום לשלם סכומי עתק מראש על סנפשוט קפוא של קטלוגים, החברה פיתחה מודל Revenue Share ייחודי ומנגנון attribution מתמטי מבוסס פטנט.
המערכת מפרקת כל תמונה מג'ונרטת לווקטורי Embeddings של קומפוזיציה, צבעים וסמנטיקה, ומחשבת את מידת ההשפעה של כל תמונה בדאטהסט על התוצר הסופי. כך, המערכת יודעת לתגמל דינמית עד 200 בעלי זכויות (Data Owners) לתמונה בודדת, ברזולוציה של סנטים בודדים, ומייצרת אינסנטיב כלכלי ליוצרים להעלות דאטה מבוקש.
2. מנרטיב טקסטואלי לשליטה מוחלטת: Rezoner, Render-Engine ו-Disentanglement
סקרן אותי להבין איך Bria פותרת את בעיית ה"אנטרופיה" והתסכול המוכר במודלים גנריים, שבהם שינוי מילה בודדת בפרומפט הורס את ה-Consistency של התמונה כולה. מישה הסביר לי שהשורש טמון בדרך שבה המודל מאומן: בעוד מודלים רגילים מאומנים על זוגות של תמונה וטקסט חופשי (Text-Image Pairs), Bria מאמנת את המודל שלה על צמדים של תמונה ומבנה JSON עשיר, מובנה וגרנולרי.
ארכיטקטורת המודל מפצלת את התהליך לשני שלבים עיקריים:
- מנוע ה-Rezoner: מקבל פרומפט בשפה טבעית (שלעתים מגיע ל-1,700 עד 2,000 מילים), וממיר אותו למבנה JSON הנדסי מפורט המגדיר אובייקטים, יחסים מרחביים, תאורה, אטמוספירה וטקסטורות.
- מנוע ה-Rendering / Diffusion: משתמש ב-JSON המפורט כדי לייצר את התמונה.
החשיבות ההנדסית של הדיסאנטנגלמנט (Disentanglement) הזה היא אדירה. המשתמש מקבל חזרה גם את התמונה וגם את קובץ ה-JSON. במידה ונדרש שינוי (למשל, החלפת צבע כיסא משחור לאדום), המשתמש מעדכן אך ורק את השדה הספציפי ב-JSON. המודל מעבד שוב את התמונה תוך שמירה על הפרדה מלאה, מבלי לפגוע בשאר הפיקסלים או באובייקטים המקבילים.
בנוסף, ארגונים יכולים לבצע Fine-tuning למודלי הקוד הפתוח של Bria על שפה ייעודית (Gen-Language). דוגמה מרתקת שעלתה בשיחה היא היכולת של אולפני האנימציה בהוליווד להגדיר שדות ייחודיים ב-JSON – כמו "צורת גבות" – ולהשיג שליטה מוחלטת בוריאציות הדמויות.
3. Pixel Fidelity והנדסה בפרודקשן: העברת המשקל מאלגוריתמיקה לתשתיות
כשאתגרתי את מישה לגבי ההתמודדות מול מודלי הענק של Google או Midjourney, תשובתו הציגה תפיסה פיקחית על פער המעבר בין POC ל-Production. עבור לקוחות Enterprise ועולמות המדיה והמרקטינג, מודל גנרי הוא פטיש 5 קילו כבד ואיטי מדי. מותגים גדולים לא יכולים להתפשר על סטייה של אפילו ערך RGB בודד בצבע המותג שלהם (מה שמישה מכנה הומוריסטית "ירוק NVIDIA"), וזקוקים ל-100% Pixel Fidelity על מוצרי הליבה שלהם.
בפרודקשן בסקייל ארגוני, מודלים של טריליוני פרמטרים נכשלים בשל Latency גבוה ועלויות מחשוב (Unit Economics) בלתי אפשריות. Bria מספקת את המודלים שלה עם משקולות וקוד פתוח (Open-Source Weights), מה שמאפשר לחברות להתקין את המודל On-premise או בענן הפרטי שלהן, להזריק דטה קסטומלי מוגן, וליהנות מעלויות Capped יציבות וזמני ריצה מהירים.
פסקת סיום ומבט לעתיד
השיחה עם מישה פיינשטיין הבהירה לי שהתעשייה כולה עוברת שלב התבגרות קריטי: מרוץ ההייפ של איכות התמונה הראשונית מתיישר, והפוקוס העובר כעת הוא מאלגוריתמיקה להנדסה מעשית. העתיד הקרוב של תחום ה-Visual Generative AI אינו טמון רק ביצירת פיקסלים יפים ברמת שטוחה, אלא במעבר לאסטים מורכבים בעלי שכבות (Layered Assets), מודלים קומפקטיים הרצים על On-device / On-prem, ויצירת כלי עבודה אמינים, יציבים וחסכוניים לאנשי המקצוע.
לפרק המלא ולכל הפרטים, האזינו כאן.
לצפייה בפרק לחצו כאן.


