כתבה
arXiv cs.LG ·
כלליות נקודתית של פעולני טרנספורמר לתחומים גדולים יותר
Zero-shot generalization of transformer neural operators to larger domains
פעולני טרנספורמר-בסיסיים הוכיחו יעילות רבה בהערכת פעולות פתרון של משוואות דיפרנציאליות חלקיות על גאומטריות מורכבות. עם זאת, התקבלות קיימת דורשת תחום קבוע, שמגביל את יכולתם להכלל באינפרנציה. במחקר זה, חקרנו הרחבת תחום, נקודתית באינפרנציה על תחומים שהם גדולים יותר מאלה שהתקבלו באימון. נטען כי זה דורש סמכות ספציפית ואינטראקטיביות. נציג להקטנה זו על ידי כפיל-פעולה ניתנת להסבר, המאפשרת סמכות ספציפית ואינטראקטיביות. נציג גם אימודים רוטטיים, המאפשרים תווי-ערך משמעותיים עם תמיכה ספציפית חד-צדדית, כלליים וללא שינוי בארכיטקטורה של הטרנספורמר. נציג גם ניסויים על שני תצוגות PDE ותצוגה 3D של זרם אטמוספירי. קוד ותצוגות זמינים בhttps://github.com/cerea-daml/domain-extension.
תקציר מקורי באנגליתarXiv:2606.14597v2 Announce Type: replace Abstract: Transformer-based neural operators have shown remarkable performance for approximating solution operators of partial differential equations on complex geometries. However, existing approaches implicitly assume a fixed domain size, which limits their ability to generalize at inference. In this work, we investigate domain extension, namely zero-shot inference on spatial domains that are significantly larger than those encountered during training. We argue that this setting fundamentally requires spatial locality and translation equivariance. We propose to implement this locality via a decomposable bias in the attention logits computation, enabling finely controllable locality while remaining fully decomposable into query-key inner products
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית