לשנות תמונות בקלות: קסם נסתר במרחב ה-Seed של AI
גלו כיצד מרחב ה-Seed במודלי דיפוזיה אינו רק רעש, אלא מחביא מידע סמנטי עשיר ונגיש. נחשוף שיטה חדשנית לתרגום תמונות מורכב ישירות במרחב זה, המשלבת את הטוב משני העולמות. שפרו את יכולות עריכת התמונות שלכם עם גישה פורצת דרך זו.

פרקים
Do you need to train a GAN per form of translation? Yeah, in this version we do train. Again, per version though, the trained GAN is trained within the state space, which is very tiny little space compared to training a cycle gun, a full cycle gun in the image pixels, it's about between 20 to 30 times faster. But yes, it's per task optimization. So is there a way to leverage something like flow matching or something like that to maybe use textual guidance? There are a few methods or a few directions to try to generalize a single network for different tasks or different applications. It's still in progress and it's possible. Definitely. Awesome, thanks. Did you find any differences or features that were not semantically apparent in the seed space? Well, if I could show you once again the table, you could see the degradation between the scene level attributes like day versus night, which we were able to classify in 98% just like in the image space. Then we went back to the object level and the subject object level and you can see the trend. Okay. So yeah, the more the light and gentle effects are harder to distinguish, at least for the resonant 18 network that we trained in the seed space. I'm not saying that it's not possible. We are not there yet. Wonderful, thanks.
שאלות ותשובות
C2C הוא מודל היברידי לתרגום תמונה לתמונה ללא זיווג, המשלב את החוזקות המשלימות של מודלי GAN ודיפוזיה. הוא פותר את הקונפליקטים המובנים והמורכבות הרב-מרחבית של שיטות מסורתיות שמתמרנות תמונות לאורך מסלול הדגימה. המודל מבצע מניפולציה במרחב ה-seed לפני תחילת תהליך הדגימה.
מרחב ה-seed מתייחס למרחב הרעש הרב-ממדי המשמש לאתחול תהליך דגימת הדיפוזיה. זרעים אלו, המכונים גם "latents", נבנים באופן מסורתי על ידי דגימה אקראית או על ידי הוספת רעש הדרגתית לתמונה קיימת בתהליך היפוך. זרעים הפוכים מקודדים מידע סמנטי עשיר על התמונה הסופית.
מניפולציה במרחב ה-seed מציעה יתרונות משמעותיים על ידי הבטחת יישור מושלם בין המקור ליעד, שכן ה-seed מתורגם לפני תחילת הדגימה. היא גם משיגה יעילות במרחב יחיד, תוך עקיפת עריכה צעד-אחר-צעד מורכבת לאורך מסלול הדגימה. זה פותר את הקונפליקט בין מאפייני ה-seed להוראות העריכה.
C2C משלב רשת CycleGAN-like (stsgun) במרחב ה-seed לתרגום זרעים, יחד עם שימוש במודל דיפוזיה מאומן מראש ליצירת התמונה הסופית. בנוסף, הוא משלב אילוץ מרחבי מבוסס ControlNet בזמן הדגימה. ה-stsgun קובע את האתחול הסמנטי הנכון, בעוד ה-ControlNet פועל כמעקה בטיחות מרחבי מפורש לאורך מסלול הדגימה, ומונע סחיפה מבנית.
כדי שמניפולציה במרחב ה-seed תהיה אפשרית, עליו להפגין שתי תכונות מפתח: מבניות ונגישות. מבניות פירושה שתנועה בכיוון מסוים במרחב ה-seed מובילה לשינוי סמנטי משמעותי ועקבי במרחב הפיקסלים. נגישות פירושה שניתן לגשת למידע הסמנטי באמצעות רשת פשוטה ולא איטרטיבית.
כן, בגרסה הנוכחית של C2C יש צורך לאמן רשת GAN עבור כל צורת תרגום. עם זאת, ה-GAN מאומן בתוך מרחב ה-seed, שהוא מרחב קטן בהרבה בהשוואה לאימון CycleGAN מלא במרחב הפיקסלים. זה הופך את התהליך למהיר פי 20 עד 30.
לא, לא כל התכונות הסמנטיות נגישות באותה מידה. בעוד שתכונות ברמת הסצנה, כמו יום לעומת לילה, ניתנות לסיווג בדיוק גבוה (98%), תכונות ברמת האובייקט ותת-האובייקט, כמו גיל, מראות ירידה בביצועים. אפקטים קלים ועדינים יותר קשים יותר להבחנה עבור רשתות פשוטות כמו Resnet 18 במרחב ה-seed.
עוד מפגשים
הבינה המלאכותית שתציל חיים: מהפכה באבחון רפואי
Idan Bassouk
הסוד ליישור מושלם: למידה עמוקה משנה את פני הראייה הממוחשבת!
Oren Freifeld
לפענח את המציאות: סודות ראיית המחשב והבינה המלאכותית
Yonatan Wexler
AI בפתולוגיה: האם הרדיולוגים באמת מקדימים אותנו ב-20 שנה?
Iris Barshack
הסוד לפתיחת עולם ה-AI: הפסאודו-הופכי הלא-ליניארי
Yamit Ehrlich
האם ישראל תהפוך למעצמת AI עולמית? התפקיד שלך!
Noa Lubin
האם שינוי סדר פשוט יכול לשפר את הקיבוץ שלך ב-77%?
Ofir Lindenbaum
הסוד של מודלי AI: איך לגרום להם לשכוח?
Yehuda Dar