Back to IMVC 2026

הסוד לפיצוח אשכולות נתונים מורכבים ב-AI!

גלו כיצד GFNCP משנה את עולם האשכולות המונפקים. במקום פתרון יחיד, אנו מציגים מודל שמייצר דגימות מהתפלגות הפוסטריורית המלאה, ומספק פתרונות מרובים וייצוג אי-ודאות. למדו על העקביות השולית ותכונת אי-התלות בסדר הנתונים שמשפרת את דיוק המודל.

Irit ChellyIrit ChellySenior Applied Researcher, Wix

פרקים

00:05הצגת המאמר: אשכולות מונפקים ו-GFNCP
00:23מעבר מפתרון יחיד להתפלגות פוסטריורית מלאה
01:09הגדרת הבעיה: אשכולות מונפקים והסקת מסקנות
02:32ההבדל המהותי: אשכולות מונפקים מול אשכולות עמוקים
03:58כיצד GFlownets עובדים: מדיניות יצירה ופונקציית תגמול
06:36המודל שלנו: אשכולות כתהליך החלטה סדרתי
08:45סקירה ארכיטקטונית: מקודד מבוסס קבוצה ופונקציית אנרגיה
09:43הקשר המכריע: GFlownets ועקביות שולית
10:31מדוע עקביות שולית חשובה: אי-תלות בסדר הנתונים
11:33תוצאות ראשוניות: נתוני צעצוע ונתוני אמת
12:17דגימת פוסטריורית: ריבוי פתרונות אפשריים
13:06הדגמת אי-תלות בסדר הנתונים: GFNCP מול NCP
13:59הערכה כמותית: מדד SDPP לעקביות
14:51תוצאות מאתגרות: ImageNet Dyno Features
15:27סיכום הממצאים העיקריים

Hi, is it possible to tune like the number of clusters that you are aiming for? What do you mean by tune? The model actually inferior the number of clusters and you cannot because it's an ill posed problem, right? You can decide normally you decide like the number of clusters that you are aiming for. We didn't try to tune it, but all the efforts done around that is to produce data set that is like enough with enough variability in terms of number of clusters. So the data was prepared with Chinese restaurant process. We first like sample the mixture we want. This gives us the k value and then we produce the data. But during inference like tuning the number is not something that we tried. We actually let the model just see the new data set and infer the number of clusters and give different probabilities to the different results. Okay, thank you.

GFNCP הוא מודל מבוסס GFLONet המטפל בבעיה של אשכולות דו-משמעיים. במקום לחזות רק פתרון אשכולות יחיד, המודל נועד לדגום מכלל ההתפלגות הפוסטריורית של האשכולות. זה מאפשר לו לייצג מספר פתרונות תקפים ואי-ודאות לגבי האשכולות.

אשכולות ממוסחר הוא מסגרת שבה המודל מאומן לדגום מההתפלגות הפוסטריורית ישירות ממערך נתונים חדש, לרוב במעבר קדימה אחד. בניגוד לשיטות אשכולות עמוקים שמקצות נקודות בנפרד על בסיס מבנה קבוע שנלמד, אשכולות ממוסחר פועל ברמת סט הנקודות כולו ומחזית הקצאות על בסיס כל הנקודות יחד. הוא גם יכול לחזות מבני קטגוריות חדשים שלא נראו באימון.

GFNCP מבטיח עקביות באמצעות עקרון העקביות השולית (marginal consistency). עקרון זה קובע שההסתברות של הקצאה חלקית חייבת להיות שווה לסכום ההסתברויות של כל ההרחבות האפשריות של אותה הקצאה. על ידי הבטחת עקביות הזרימה במודל, GFNCP גורם לכך שכל המסלולים המייצגים תמורות שונות של הנתונים מובילים לאותו פתרון אשכולות סופי, ובכך הופך את המודל לבלתי תלוי בסדר הנקודות בקלט.

כן, המודל GFNCP יכול להסיק את מספר רכיבי האשכולות באופן אוטומטי. במהלך תהליך ההקצאה, הרשת יכולה להקצות נקודות לאשכולות קיימים או לאשכול חדש לגמרי. יכולת זו מאפשרת למודל לקבוע את מספר האשכולות המתאים למערך נתונים נתון.

GFNCP מציג ביצועים תחרותיים במשימות אשכולות על נתוני צעצוע ונתונים אמיתיים, כולל ImageNet. הוא מסוגל לדגום מהתפלגות פוסטריורית שלמה של אשכולות, מה שמאפשר לו לייצר פתרונות אשכולות מגוונים. המודל גם שומר על חסינות לסדר הקלט של הנקודות, ומפחית משמעותית את סטיית התקן של ההסתברויות תחת תמורות נתונים שונות.

GFNCP מתאים את מסגרת ה-GFlownet על ידי ניסוח אשכולות כתהליך קבלת החלטות סדרתי. כל מצב ביניים מייצג הקצאה חלקית של נקודות, והמצב הסופי מייצג הקצאת אשכולות מלאה. המודל לומד ערכי זרימה המייצגים את ההסתברות של הקצאות, וערכים אלה משמשים לדגימת מסלולים, שהם למעשה דגימות מההתפלגות הפוסטריורית של האשכולות.

GFlownets הם מודלים הלומדים מדיניות גנרטיבית המאפשרת לדגום אובייקטים או פתרונות סופיים בהסתברות פרופורציונלית לפונקציית תגמול מסוימת. בניגוד לשיטות אופטימיזציה אחרות, מטרתם אינה למצוא את הפתרון הטוב ביותר, אלא לייצג את כל הפתרונות האפשריים. אובייקטים נבנים באופן סדרתי, מה שמאפשר ל-GFlownets למדל מסלולים שונים ולייצג מצבים מרובים ופתרונות מגוונים.