Back to IMVC 2026

לשנות תמונות בקלות: קסם נסתר במרחב ה-Seed של AI

גלו כיצד מרחב ה-Seed במודלי דיפוזיה אינו רק רעש, אלא מחביא מידע סמנטי עשיר ונגיש. נחשוף שיטה חדשנית לתרגום תמונות מורכב ישירות במרחב זה, המשלבת את הטוב משני העולמות. שפרו את יכולות עריכת התמונות שלכם עם גישה פורצת דרך זו.

Or GrenbergOr GrenbergAI researcher, General Motors

פרקים

00:09הצגת C2C: תרגום תמונות במרחב ה-Seed
00:39מהו מרחב ה-Seed ואיך הוא נוצר?
01:28הפוטנציאל הנסתר: מידע סמנטי ב-Seed
01:50שני עמודי התווך: מבנה ונגישות במרחב ה-Seed
02:39למה לא לערוך תמונות בדרך המסורתית?
03:56הפתרון האלגנטי: עריכה ישירה במרחב ה-Seed
04:22ניסוי 1: הוכחת המבנה הסמנטי של מרחב ה-Seed
05:48ניסוי 2: גישה למידע סמנטי עם רשת פשוטה
07:24האתגר: תרגום תמונה-לתמונה לא מזווג
08:40C2C: שילוב עוצמתי של GAN ומודלי דיפוזיה
09:02איך C2C עובד? פירוט השלבים
10:58C2C בפעולה: השוואות וביצועים מרהיבים
12:13הכללה רחבה: מאיכות רכב ועד פורטרטים
12:49סיכום: העתיד של מניפולציית תמונות ב-AI
13:38שאלות ותשובות: יתרונות ושיפורים עתידיים

Do you need to train a GAN per form of translation? Yeah, in this version we do train. Again, per version though, the trained GAN is trained within the state space, which is very tiny little space compared to training a cycle gun, a full cycle gun in the image pixels, it's about between 20 to 30 times faster. But yes, it's per task optimization. So is there a way to leverage something like flow matching or something like that to maybe use textual guidance? There are a few methods or a few directions to try to generalize a single network for different tasks or different applications. It's still in progress and it's possible. Definitely. Awesome, thanks. Did you find any differences or features that were not semantically apparent in the seed space? Well, if I could show you once again the table, you could see the degradation between the scene level attributes like day versus night, which we were able to classify in 98% just like in the image space. Then we went back to the object level and the subject object level and you can see the trend. Okay. So yeah, the more the light and gentle effects are harder to distinguish, at least for the resonant 18 network that we trained in the seed space. I'm not saying that it's not possible. We are not there yet. Wonderful, thanks.

C2C הוא מודל היברידי לתרגום תמונה לתמונה ללא זיווג, המשלב את החוזקות המשלימות של מודלי GAN ודיפוזיה. הוא פותר את הקונפליקטים המובנים והמורכבות הרב-מרחבית של שיטות מסורתיות שמתמרנות תמונות לאורך מסלול הדגימה. המודל מבצע מניפולציה במרחב ה-seed לפני תחילת תהליך הדגימה.

מרחב ה-seed מתייחס למרחב הרעש הרב-ממדי המשמש לאתחול תהליך דגימת הדיפוזיה. זרעים אלו, המכונים גם "latents", נבנים באופן מסורתי על ידי דגימה אקראית או על ידי הוספת רעש הדרגתית לתמונה קיימת בתהליך היפוך. זרעים הפוכים מקודדים מידע סמנטי עשיר על התמונה הסופית.

מניפולציה במרחב ה-seed מציעה יתרונות משמעותיים על ידי הבטחת יישור מושלם בין המקור ליעד, שכן ה-seed מתורגם לפני תחילת הדגימה. היא גם משיגה יעילות במרחב יחיד, תוך עקיפת עריכה צעד-אחר-צעד מורכבת לאורך מסלול הדגימה. זה פותר את הקונפליקט בין מאפייני ה-seed להוראות העריכה.

C2C משלב רשת CycleGAN-like (stsgun) במרחב ה-seed לתרגום זרעים, יחד עם שימוש במודל דיפוזיה מאומן מראש ליצירת התמונה הסופית. בנוסף, הוא משלב אילוץ מרחבי מבוסס ControlNet בזמן הדגימה. ה-stsgun קובע את האתחול הסמנטי הנכון, בעוד ה-ControlNet פועל כמעקה בטיחות מרחבי מפורש לאורך מסלול הדגימה, ומונע סחיפה מבנית.

כדי שמניפולציה במרחב ה-seed תהיה אפשרית, עליו להפגין שתי תכונות מפתח: מבניות ונגישות. מבניות פירושה שתנועה בכיוון מסוים במרחב ה-seed מובילה לשינוי סמנטי משמעותי ועקבי במרחב הפיקסלים. נגישות פירושה שניתן לגשת למידע הסמנטי באמצעות רשת פשוטה ולא איטרטיבית.

כן, בגרסה הנוכחית של C2C יש צורך לאמן רשת GAN עבור כל צורת תרגום. עם זאת, ה-GAN מאומן בתוך מרחב ה-seed, שהוא מרחב קטן בהרבה בהשוואה לאימון CycleGAN מלא במרחב הפיקסלים. זה הופך את התהליך למהיר פי 20 עד 30.

לא, לא כל התכונות הסמנטיות נגישות באותה מידה. בעוד שתכונות ברמת הסצנה, כמו יום לעומת לילה, ניתנות לסיווג בדיוק גבוה (98%), תכונות ברמת האובייקט ותת-האובייקט, כמו גיל, מראות ירידה בביצועים. אפקטים קלים ועדינים יותר קשים יותר להבחנה עבור רשתות פשוטות כמו Resnet 18 במרחב ה-seed.