לאחרונה, ChatGPT הפכה לנקודה החמה החדשה של AI, כאשר מיקרוסופט וגוגל בעמק הסיליקון משקיעות רבות בטכנולוגיה כזו (למיקרוסופט יש נתח של 10 מיליארד דולר ב-OpenAI, החברה שמאחורי ChatGPT, וגוגל הוציאה לאחרונה מודל BARD משלה). בעוד שחברות טכנולוגיות אינטרנט בסין, המיוצגות על ידי Baidu ואחרות, ציינו גם הן כי הן מפתחות טכנולוגיה כזו ויעלו לאוויר בעתיד הקרוב. גם בסין, Baidu וחברות טכנולוגיות אינטרנט אחרות ציינו שהן מפתחות טכנולוגיות כאלה ויעברו לאוויר בעתיד הקרוב.
למודלים הגנרטיביים המיוצגים על ידי ChatGPT יש תכונה משותפת, כלומר, הם משתמשים בנתונים מסיביים לצורך אימון מקדים, ולעתים קרובות הם משודכים למודל שפה חזק יותר. תפקידו העיקרי של מודל השפה הוא ללמוד מהקורפוס הקיים המאסיבי, ולאחר הלמידה הוא יכול להבין את ההוראות הלשוניות של המשתמש, או יתרה מכך, לייצר פלט טקסט רלוונטי בהתאם להוראות המשתמש.
ניתן לסווג מודלים גנרטיביים באופן נרחב לשתי קטגוריות, האחת היא מודלים גנרטיביים מבוססי שפה והשנייה היא מודלים גנרטיביים מבוססי תמונה. המודלים הגנרטיביים מבוססי השפה מיוצגים על ידי ChatGPT, שמודל השפה שלו יכול לא רק ללמוד להבין את המשמעות של פקודות משתמש (למשל, "לכתוב שיר, בסגנון לי באי"), אלא גם ליצור טקסט רלוונטי המבוסס על המשתמש פקודות לאחר אימון עם נתונים מסיביים (בדוגמה לעיל, כתיבת שיר בסגנון לי באי). שִׁיר). המשמעות היא ש-ChatGPT צריך להיות בעל מודל שפה גדול (LLM) שמבין את שפת המשתמש ויכול לייצר פלט שפה איכותי - למשל, על המודל להבין איך יוצרים שירים, איך יוצרים שירים בסגנון לי באי. , וכולי. זה גם אומר שמודלים של שפה גדולים ב-AI גנראטיבי מבוסס שפה דורשים מספר רב מאוד של פרמטרים על מנת לבצע סוג כזה של למידה מורכבת ולזכור כל כך הרבה מידע. ל-ChatGPT, למשל, יש 175 מיליארד פרמטרים (700 GB של שטח אחסון אם משתמשים במספרי נקודה צפה סטנדרטית), מה שמראה כמה "גדול" מודל השפה שלו.
סוג נוסף של מודלים גנרטיביים הוא מודל יצירת התמונה המיוצג על ידי Diffusion, בדרך כלל Dalle מ-OpenAI, ImaGen מ-Google, וכרגע ה-Stable Diffusion הפופולרי ביותר מ- Runway AI. מודלים דמויי תמונה אלה משתמשים גם במודל שפה כדי להבין את הפקודות הלשוניות של המשתמש ולאחר מכן ליצור תמונות באיכות גבוהה על סמך הפקודות הללו. בניגוד למודלים יצירתיים מבוססי שפה, מודל השפה המשמש כאן משתמש בעיקר בשפה כדי להבין את קלט המשתמש מבלי ליצור פלט שפה, כך שמספר הפרמטרים יכול להיות קטן למדי (בסדר גודל של כמה מאות מיליונים), בעוד שמספר הפרמטרים עבור מודלים של דיפוזיה מבוססי תמונה הם קטנים יחסית, בסדר גודל של מיליארדים בודדים בסך הכל, אך המאמץ החישובי אינו קטן מכיוון שהרזולוציה של התמונות או הסרטונים שנוצרו יכולה להיות גבוהה מאוד.
מודלים גנרטיביים יכולים לייצר תפוקה באיכות גבוהה חסרת תקדים באמצעות אימון נתונים מאסיבי, וכבר קיימים מספר שווקי יישומים ברורים, כולל חיפוש, בוטים של דיאלוגים, יצירת תמונות ועריכה וכו'. בעתיד צפויות יישומים נוספים, מה שגם מציב ביקוש עבור שבבים קשורים.
הצורך בשבבים ליצירת דגמי כיתה
כפי שהוזכר קודם לכן, ChatGPT מייצג מודל יצירתי שצריך ללמוד מכמויות גדולות של נתוני אימון על מנת להשיג תפוקה יצירתית באיכות גבוהה. על מנת לתמוך בהדרכה יעילה והסקת מסקנות, למודלים גנרטיביים יש דרישות משלהם לשבבים קשורים.
הראשון הוא הצורך בחישוב מבוזר; מספר הפרמטרים של מודלים מחוללים שפה כמו ChatGPT הוא במאות מיליארדים, וכמעט בלתי אפשרי להשתמש בהדרכה והסקת מחשב בודד, אבל יש להשתמש בהרבה חישובים מבוזרים. במחשוב מבוזר, לרוחב הפס של חיבור הנתונים בין מכונות לשבב המחשוב עבור מחשוב מבוזר כזה (כגון RDMA) יש ביקוש רב, מכיוון שלעיתים קרובות צוואר הבקבוק של המשימה עשוי להיות לא במחשוב, אלא בחיבור הנתונים לעיל, במיוחד ב מסוג זה של מחשוב מבוזר בקנה מידה גדול, השבב לתמיכה יעילה של מחשוב מבוזר הפך קריטי יותר.
הבא הוא קיבולת הזיכרון ורוחב הפס. למרות שאימון מבוזר והסקת מסקנות הם בלתי נמנעים עבור מודלים מחוללים מבוססי שפה, הזיכרון המקומי ורוחב הפס של כל שבב יקבעו במידה רבה את יעילות הביצוע של שבב בודד (מכיוון שהזיכרון של כל שבב משמש עד קצה גבול היכולת). עבור דגמים יצירתיים מבוססי תמונה, ניתן להכניס את הדגמים (בסביבות 20GB) כולם בזיכרון השבב, אך ככל שדגמים יצירתיים מבוססי תמונה יתפתחו בהמשך, סביר להניח שגם דרישות הזיכרון שלו יגדלו עוד יותר. . מנקודת מבט זו, טכנולוגיית זיכרון ברוחב פס גבוה במיוחד המיוצגת על ידי HBM תהפוך לבחירה הבלתי נמנעת עבור שבבי מאיץ קשורים, בעוד שדגמי הכיתה הגנרטיביים יאיץ גם את זיכרון HBM כדי להגדיל עוד יותר את הקיבולת ורוחב הפס. בנוסף ל-HBM, לטכנולוגיות אחסון חדשות כמו CXL יחד עם אופטימיזציות תוכנה תהיה גם פוטנציאל להגדיל את הקיבולת והביצועים של אחסון מקומי ביישומים כאלה, וההערכה היא שהן ירוויחו יותר אימוץ תעשייתי מהעלייה של מודל המעמד הגנרטיבי.
לבסוף, חישוב, גם למודלים מחלקים יצירתיים מבוססי שפה וגם מבוססי-תמונה יש ביקוש חישובי גדול, ולמודלים יצירתיים מבוססי-תמונה עשוי להיות ביקוש גבוה בהרבה לעוצמה אריתמטית שכן הם יוצרים רזולוציות גבוהות יותר ויותר ומתקדמים לעבר יישומי וידאו - עדכניים למודלים של יצירת תמונות מיינסטרים יש נפח חישובי של כ-20 TFlops, ולגבי רזולוציה גבוהה ותמונות, סביר להניח ש-100-1000 TFLOPS של דרישה אריתמטית היא הנורמה.
לסיכום, אנו מאמינים כי הדרישות של מודלים גנרטיביים לשבבים כוללים מחשוב מבוזר, אחסון וחישוב, שניתן לומר כי כרוכים בכל ההיבטים של תכנון שבבים, וחשוב מכך, כיצד לשלב את כל הדרישות הללו יחד בצורה סבירה להבטיח שהיבט אחד לא יהפוך לצוואר בקבוק, מה שיהפוך גם לבעיה הנדסית של מערכות תכנון שבבים.
GPU ושבב ה-AI החדש, למי יש סיכוי טוב יותר
לדגמים גנרטיביים יש דרישה חדשה לצ'יפים. למי יש סיכוי טוב יותר לתפוס את הביקוש והשוק החדשים הללו עבור GPUs (מיוצגים על ידי Nvidia ו-AMD) ושבבי AI חדשים (מיוצגים על ידי Habana, GraphCore)?
ראשית, מנקודת המבט של מודלים גנרטיביים מבוססי שפה, ספקי GPU שיש להם כיום פריסה מלאה בסוג זה של אקולוגיה הם בעלי יתרון רב יותר בגלל המספר העצום של משתתפים והצורך בתמיכה טובה במחשוב מבוזר. מדובר בבעיה הנדסית מערכת הדורשת פתרון תוכנה וחומרה מלא, ובעניין זה, Nvidia שילבה את ה-GPUs שלה כדי להשיק את פתרון Triton, התומך באימון מבוזר והסקה מבוזרת, המאפשר לחלק את המודל למספר חלקים ולעבד אותו. על GPUs שונים, ובכך לפתור את הבעיה של יותר מדי פרמטרים שלא ניתן להכיל בזיכרון הראשי של GPU אחד. זה פותר את הבעיה של יותר מדי פרמטרים עבור הזיכרון הראשי של GPU אחד. בין אם אתה משתמש ישירות ב-Triton או בפיתוח נוסף על בסיס Triton בעתיד, נוח יותר לקבל GPU אקולוגי שלם. מנקודת מבט חישובית, מכיוון שהחישוב העיקרי של מודל הדור מבוסס השפה הוא חישוב מטריקס, שהוא החוזק של ה-GPU, לשבב ה-AI החדש אין יתרון ברור על ה-GPU מנקודת מבט זו.
מנקודת המבט של מודלים לדור מבוסס-תמונה, גם מספר הפרמטרים של מודלים כאלה הוא גדול, אך קטן בסדרי גודל אחד עד שניים ממודלים של דור מבוסס-שפה, בנוסף לחישוב שלו עדיין ישמש ב- מספר חישובים קונבולוציוניים, אז יישומי מסקנות, אם אתה יכול לעשות אופטימיזציה טובה מאוד, לשבבי בינה מלאכותית עשויות להיות כמה הזדמנויות. כאן האופטימיזציה כוללת כמות גדולה של אחסון על-שבב כדי להכיל פרמטרים ותוצאות חישוב ביניים, לקונבולציה ותמיכה יעילה בפעולות המטריצה.
באופן כללי, הדור הנוכחי של שבבי AI מתוכנן למקד לדגמים קטנים יותר (מספר פרמטרים ברמת המיליארד, חישוב ברמת 1TOPS), בעוד שהביקוש לדגמים גנרטיביים עדיין גדול יחסית מיעד התכנון המקורי. GPUs מתוכננים להיות גמישים יותר במחיר של יעילות, בעוד שבבי AI מתוכננים לעשות את ההיפך, ולרדוף אחר היעילות של יישום היעד. לכן, אנו מאמינים שמעבדי GPU עדיין ישלטו בהאצת מודלים גנרטיבית כזו בשנה-שנתיים הקרובות, אך ככל שעיצובי המודלים הגנרטיביים הופכים יציבים יותר ולעיצובי שבבי בינה מלאכותית יש זמן להדביק את איטרציות המודל הגנרטיביות, לשבבי בינה מלאכותית יש הזדמנות לעלות על ה-GPU במרחב המודל הגנרטיבי מנקודת מבט של יעילות.

