HomeVideos

The End of the GPU Era? AMD's Helios and OpenAI Strategy

Now Playing

The End of the GPU Era? AMD's Helios and OpenAI Strategy

Transcript

429 segments

0:00

قامت AMD بشيء لم تفعله

0:01

من قبل. لم تطلق مجرد

0:03

وحدة معالجة رسوميات (

0:04

GPU) أخرى. بل كشفت لنا

0:05

عن خادم ذكاء اصطناعي

0:07

متكامل. 72 وحدة معالجة

0:08

رسوميات، ومعالجات

0:09

مركزية، وشبكة خاصة،

0:11

صممت جميعها لتعمل

0:12

كآلة واحدة مترابطة.

0:13

أطلقوا عليه اسم "

0:14

هيليوس". وأصبحت هذه

0:16

القصة أكثر إثارة لأن

0:17

OpenAI تشتري "هيليوس"

0:18

بينما تعمل في الوقت

0:19

نفسه على تطوير شريحة

0:20

الذكاء الاصطناعي

0:21

الخاصة بها. للإجابة

0:23

على ذلك، نحتاج لفهم

0:24

ماهية نظام الرف (

0:25

Rack-scale) ولماذا قد تكون

0:27

الوصلات بين وحدات

0:28

المعالجة بنفس أهمية

0:30

الوحدات نفسها. لنبدأ.

0:38

تتفوق وحدة معالجة

0:39

الرسوميات في نوع واحد

0:40

من العمل، وهو تنفيذ

0:42

أعداد هائلة من

0:43

العمليات الحسابية

0:44

بالتوازي. وهذا بالضبط

0:45

ما يحتاجه الذكاء

0:46

الاصطناعي. لكن وحدة

0:48

معالجة واحدة لا تكفي

0:49

لتدريب النماذج

0:50

الرائدة أو لخدمة أكبر

0:51

الإصدارات لملايين

0:52

المستخدمين في آن واحد

0:54

. النماذج الرائدة

0:55

تعني ببساطة أكبر

0:55

نماذج الذكاء

0:56

الاصطناعي وأكثرها

0:57

قدرة يتم بناؤها اليوم

0:58

. نماذج مثل GPT و Gemini و

1:00

Claude. يمكن أن تصل إلى

1:02

مئات المليارات من

1:03

المعاملات، واستيعاب

1:04

كل ذلك، بالإضافة إلى

1:05

ذاكرة العمل المطلوبة

1:06

أثناء التشغيل، يتطلب

1:07

مساحة أكبر بكثير مما

1:08

توفره وحدة معالجة

1:09

واحدة. لذا، يتم تقسيم

1:10

أعباء العمل هذه عبر

1:11

العديد من وحدات

1:12

معالجة الرسوميات.

1:13

أحيانًا العشرات،

1:14

وأحيانًا الآلاف. لكن

1:16

تقسيم العمل يخلق

1:17

مشكلة جديدة. تحتاج

1:18

تلك الوحدات باستمرار

1:20

إلى تبادل أجزاء من

1:21

النموذج والنتائج

1:22

الوسيطة. إذا كان هذا

1:23

التبادل بطيئًا،

1:24

فسيقضي حتى أسرع معالج

1:26

وقتًا في الانتظار

1:27

أكثر من وقت الحساب.

1:28

وهذه هي المشكلة التي

1:29

صُمم نظام الرف لحلها.

1:31

فهو يضم وحدات معالجة،

1:33

ومعالجات مركزية،

1:34

وذاكرة، وشبكات تم

1:35

هندستها معًا كنظام

1:36

واحد. الاتصال بين

1:37

وحدات المعالجة أسرع

1:38

بكثير من شبكة مراكز

1:39

البيانات العادية. على

1:41

الرغم من أنه لا يزال

1:42

أبطأ من قراءة وحدة

1:43

المعالجة من ذاكرتها

1:44

الخاصة. واجهت Nvidia هذه

1:45

المشكلة منذ سنوات،

1:47

وأصبح حلها أحد أكبر

1:48

مزاياها. إجابة Nvidia

1:50

تسمى NVLink، وهو اتصال

1:51

مباشر عالي السرعة بين

1:53

وحدات المعالجة. أضف

1:55

محول NV وسيمكن لـ NVLink

1:56

ربط 72 وحدة معالجة في

1:58

مجموعة واحدة مترابطة

1:59

بإحكام. الآن، لا تصبح

2:01

وحدات المعالجة

2:02

حرفيًا وحدة واحدة،

2:03

لكن يمكن للبرمجيات

2:04

توزيع عبء العمل عليها

2:05

جميعًا دون الاعتماد

2:06

على شبكة عادية في كل

2:08

خطوة. وهذا ما يشغل

2:10

رفوف NVL72 من Nvidia. وهذا

2:12

جزء كبير من ميزة Nvidia

2:13

التنافسية. الأمر لا

2:15

يتعلق فقط بوحدة

2:16

المعالجة. تسيطر Nvidia

2:17

على وحدة المعالجة،

2:18

والوصلات البينية،

2:20

والمحولات، و CUDA،

2:21

وطبقة البرمجيات التي

2:22

تبني عليها بالفعل كل

2:24

فرق الذكاء الاصطناعي.

2:25

توفر Nvidia أيضًا

2:27

الشبكات التي تربط

2:28

رفًا بآخر. إذا اخترت

2:30

Nvidia، فمعظم أعمال

2:31

التكامل الصعبة تكون

2:32

قد أنجزت بالفعل من

2:34

أجلك. وهذا هو النظام

2:35

الذي تحاول AMD الآن

2:37

تحديه. "هيليوس" هو أول

2:38

تصميم مرجعي على مستوى

2:40

الرف من AMD. والآن، هذا

2:42

هو سبب أهمية المراجع.

2:43

لا تبيع AMD لك الحامل (

2:45

الراك) مباشرة. شركاء

2:47

مثل سوبر مايكرو و HP

2:48

يبنون الأنظمة

2:49

باستخدام مخططات AMD.

2:50

وهذا المخطط مبني حول

2:52

معايير مفتوحة بدلاً

2:54

من امتلاك AMD لكل قطعة.

2:55

لنبدأ بالحوسبة. حامل "

2:57

هيليوس" الواحد يحتوي

2:59

على 72 وحدة من وحدات

3:00

معالجة الرسومات

3:01

الجديدة Instinct MI250X من AMD

3:03

. كل واحدة منها تحمل

3:04

HBM4، وهو جيل جديد من

3:05

الذاكرة ذات النطاق

3:06

الترددي العالي

3:07

موضوعة بجانب وحدة

3:08

المعالجة مباشرة،

3:09

لتصل البيانات إليها

3:10

بسرعة. عبر الحامل

3:11

بأكمله، يصل ذلك إلى

3:13

حوالي 31 تيرابايت من

3:14

الذاكرة. وهذا أكثر

3:16

بنحو 50%مما يقدمه نظام

3:17

"فيرا روبين" القادم من

3:19

إنفيديا لكل وحدة

3:20

معالجة رسومات. هذا

3:21

مهم لأنك كلما احتفظت

3:22

بجزء أكبر من النموذج

3:23

داخل حامل واحد، قلّت

3:24

البيانات التي تحتاج

3:25

لنقلها بين الحوامل.

3:26

ونقل البيانات بين

3:28

الحوامل يكون أبطأ.

3:29

والآن، كيف تتواصل

3:30

وحدات معالجة

3:31

الرسومات الـ 72 هذه مع

3:32

بعضها البعض فعلياً؟

3:33

تستخدم AMD تقنية UALink،

3:35

وهي ليست نسخة مفتوحة

3:37

من NVLink، بل معيار ربط

3:38

منفصل بنته مجموعة

3:40

صناعية لحل المشكلة

3:41

نفسها. نقل البيانات

3:43

بسرعة بين المسرعات

3:44

داخل الحامل الواحد.

3:45

بين الحوامل، تتغير

3:47

المهمة. وهنا يأتي دور

3:49

شبكات Pensando التابعة لـ

3:51

AMD. إنها تستخدم

3:52

الإيثرنت مع دعم Ultra

3:53

Ethernet، وهي جهود صناعية

3:54

لجعل الإيثرنت يعمل

3:56

بشكل أفضل مع مجموعات

3:57

الذكاء الاصطناعي

3:58

الضخمة. داخل الحامل

3:59

توجد صواني خوادم أصغر

4:01

. كل صينية تربط أربع

4:02

وحدات معالجة رسومات

4:03

بواحدة من وحدات

4:04

المعالجة المركزية EPYC

4:05

الجديدة من AMD، والتي

4:06

تحمل الاسم الرمزي Venice

4:07

. تعمل وحدة المعالجة

4:08

المركزية كمضيف. فهي

4:09

تدير الذاكرة،

4:10

والتخزين، والشبكات،

4:11

وتدفق البيانات

4:12

اللازم لإبقاء وحدة

4:13

معالجة الرسومات

4:14

مشغولة. لم تكن AMD

4:15

لتتمكن من بناء حامل

4:16

كهذا باستخدام وحدات

4:17

معالجة الرسومات

4:17

وحدها. كانت بحاجة إلى

4:19

الشبكات، وتكامل

4:20

الحوامل، والبرمجيات.

4:21

وقد أمضت سنوات في

4:22

الاستحواذ على ما

4:23

يؤهلها لكل هذه

4:23

المجالات الثلاثة.

4:24

شركة Pensando، التي تم

4:25

شراؤها في 2022، جلبت

4:27

رقائق الشبكات التي

4:28

توجد الآن داخل كل

4:29

صينية في هيليوس. شركة

4:30

Zt Systems، التي تم شراؤها

4:32

في 2025، جلبت خبرة

4:34

تصميم ودمج كامل حوامل

4:36

الخوادم لأكبر شركات

4:37

السحابية في العالم.

4:39

استحواذات أصغر، بما

4:40

فيها not.ai و Mipsology، جلبت

4:42

خبرة إضافية في

4:43

برمجيات الذكاء

4:44

الاصطناعي بينما

4:46

استمرت AMD في تحسين ROCm،

4:47

بديلها مفتوح المصدر

4:49

لـ CUDA من إنفيديا. قد

4:51

يكون جزء البرمجيات

4:52

هذا هو أصعب جزء في

4:53

الرهان بأكمله. لقد

4:54

حظيت CUDA بسبق دام

4:55

عقداً من الزمن، ومعظم

4:56

فرق الذكاء الاصطناعي

4:58

قد بنت أدواتها حولها

4:59

بالفعل. يمكن أن يمتلك

5:00

الحامل أجهزة رائعة

5:01

ولكنه يفشل إذا كان

5:02

نقل عبء عمل حقيقي

5:03

إليه يتطلب شهوراً من

5:04

الهندسة الإضافية.

5:06

بناء الحامل كان نصف

5:07

المهمة فقط. السؤال

5:09

الأصعب كان دائماً عما

5:10

إذا كان أي شخص سيثق به

5:11

في بيئة الإنتاج. أكدت

5:13

مايكروسوفت للتو أن

5:14

خدمة Azure القادمة

5:15

ستستخدم "هيليوس"

5:16

لتشغيل نماذج الذكاء

5:17

الاصطناعي على نطاق

5:18

الإنتاج. كانت أوراكل

5:19

قد التزمت بالفعل بـ "

5:21

هيليوس" في وقت سابق.

5:22

انضمام مايكروسوفت

5:23

مهم بشكل خاص لأن Azure

5:24

تدير بعضاً من أكثر

5:25

أعباء عمل الذكاء

5:26

الاصطناعي تطلباً على

5:27

كوكب الأرض. هذا ليس

5:28

مجرد شراء لوحدة

5:29

معالجة رسوميات. نظام

5:30

مثل "هيليوس" يؤثر على

5:32

الطاقة، والتبريد،

5:33

والشبكات، والبرمجيات

5:34

في مركز البيانات

5:35

بالكامل. مايكروسوفت

5:36

مستعدة لبناء بنية

5:37

تحتية إنتاجية حوله،

5:39

وهذا يمثل اعترافاً

5:40

حقيقياً بقدرات AMD.

5:41

وهذا يخبرنا بما

5:42

يتنافس عليه نظام "

5:44

هيليوس" حقاً. ثم هناك

5:45

شركة أخرى تجعل قصة "

5:47

هيليوس" أكثر إثارة

5:48

للاهتمام، وهي OpenAI.

5:50

لدى OpenAI بالفعل

5:51

اتفاقية ضخمة مع شركة

5:53

AMD. تخطط الشركة لنشر

5:54

ما يصل إلى 6 جيجاوات

5:55

من وحدات معالجة

5:56

الرسوميات الخاصة بـ

5:57

AMD. ولكن هنا يكمن

5:58

الجزء المثير

5:58

للاهتمام. تعمل OpenAI

6:00

أيضاً على بناء

6:01

شريحتها الخاصة. تُسمى

6:02

"هابانيرو"، وقد تم

6:03

تطويرها بالتعاون مع

6:04

شركة برودكوم. إذن،

6:06

لماذا قد تبني OpenAI

6:07

شريحتها الخاصة بينما

6:08

لا تزال تشتري وحدات

6:09

معالجة رسوميات من AMD و

6:10

Nvidia؟ لفهم ذلك، نحتاج

6:12

إلى الفصل بين أمرين

6:13

نضعهما غالباً تحت

6:14

مسمى "حوسبة الذكاء

6:15

الاصطناعي". التدريب

6:16

والاستنتاج. التدريب

6:18

هو الوقت الذي نقوم

6:19

فيه ببناء النموذج

6:20

فعلياً. أنت تعالج

6:21

كميات هائلة من

6:22

البيانات وتحدث

6:23

مليارات المعلمات

6:24

مراراً وتكراراً.

6:25

يتطلب ذلك كميات ضخمة

6:26

من الحوسبة، والذاكرة

6:28

، واتصالاً فائق

6:29

السرعة بين وحدات

6:30

معالجة الرسوميات.

6:31

الاستنتاج هو ما يحدث

6:32

بعد تدريب النموذج.

6:34

أنت ترسل طلباً إلى

6:35

ChatGPT، فيولد النموذج

6:36

رموزاً، وهنا تصبح

6:38

أمور مثل زمن

6:38

الاستجابة،

6:39

والإنتاجية، وكفاءة

6:41

الطاقة مهمة للغاية.

6:42

وقد صُممت "هالابينيو"

6:44

خصيصاً لعبء عمل

6:45

الاستنتاج هذا. تقول

6:46

OpenAI إنها لم تكتفِ

6:48

بتصميم شريحة ثم بناء

6:49

خادم حولها. بل صممت

6:50

الشريحة، والذاكرة،

6:52

والشبكات، والبرمجيات

6:53

معاً بناءً على كيفية

6:54

تشغيل نماذج اللغة

6:55

الكبيرة فعلياً. لقد

6:57

نشرت OpenAI الآن أول

6:58

نتيجة قياس أداء

6:59

لشريحة "هالابينيو". في

7:00

اختبارها الخاص، سجلت

7:01

إنتاجية أفضل لكل

7:02

كيلووات وزمن استجابة

7:04

أقل مقارنة بالأنظمة

7:05

التجارية التي تمت

7:06

مقارنتها بها. لكن هذه

7:07

هي نتائج قياس الأداء

7:08

الخاصة بـ OpenAI، لذا لن

7:10

أعتبرها دليلاً على أن

7:11

"هالابينيو" ستحل فجأة

7:13

محل Nvidia. وشركة OpenAI

7:14

نفسها لا تفعل ذلك

7:15

أيضاً. فهي تقول إنها

7:17

ستواصل نشر المسرعات

7:19

من Nvidia وشركاء آخرين.

7:20

وفي الوقت نفسه، فهي

7:22

تشتري من AMD. ولأعباء

7:24

العمل التي تتطلب

7:25

تكاملاً أوثق بين

7:26

الأجهزة والبرمجيات،

7:27

فهي تبني أشباه موصلات

7:28

خاصة بها. إذن، قد لا

7:29

تكون هناك شريحة واحدة

7:30

فائزة لكل شيء في مجال

7:31

الذكاء الاصطناعي. قد

7:32

تستخدم شركة نظاماً

7:34

واحداً لتدريب

7:34

النماذج الرائدة،

7:35

وآخر للاستنتاج عالي

7:37

الإنتاجية، وأجهزة

7:38

متخصصة عندما تكون

7:39

الأولوية لزمن

7:39

الاستجابة أو كفاءة

7:41

الطاقة. وهذا يعيدنا

7:42

إلى ما يتنافس عليه

7:43

نظام "هيليوس" في

7:44

الواقع. وحدة معالجة

7:45

الرسوميات نفسها هي

7:47

مجرد جزء واحد من

7:48

النظام. إن كيفية

7:49

توصيل أشباه الموصلات

7:50

بمقياس الخادم الصحيح

7:51

، والذاكرة، والترابط

7:52

، والشبكات،

7:53

والبرمجيات، لا تقل

7:54

أهمية عن الشريحة

7:55

الموجودة في قلب

7:56

النظام. لقد بنت Nvidia

7:58

نظاماً متكاملاً

7:59

بإحكام تتحكم فيه في

8:00

معظم الطبقات المهمة.

8:02

وقد ساعد ذلك في ترسيخ

8:03

مكانة مهيمنة لها في

8:04

بنية الذكاء

8:05

الاصطناعي التحتية.

8:06

تراهن AMD مع مشروع Helios

8:08

على أنه إذا تحالفت

8:10

الصناعة حول معايير

8:12

مفتوحة، مثل الاعتماد

8:13

على Ethernet بدلًا من NVLink

8:15

، و ROCm بدلًا من CUDA،

8:17

فسيصبح كسر تلك الميزة

8:19

أسهل. مشروع Helios لا

8:20

يعني أن AMD قد لحقت بـ

8:22

Nvidia، لكنه يعني أن Nvidia

8:23

لديها أخيرًا منافس

8:25

جدي على مستوى الخوادم

8:26

، ومايكروسوفت مستعدة

8:28

لاستخدامه في الإنتاج.

8:31

مشروع Helios لا يعني أن

8:33

AMD لحقت بـ Nvidia، بل

8:35

يعني وجود بدائل. AMD

8:38

تنافس الآن على مستوى

8:40

وحدات الخوادم (الـ Rack)

8:42

. يقوم مقدمو الخدمات

8:43

السحابية ببناء

8:44

مسرعاتهم الخاصة،

8:46

وبدأت OpenAI في تصميم

8:47

عتاد مخصص لأحمال

8:48

عملها. لا تزال Nvidia

8:49

تمتلك أقوى نظام بيئي،

8:51

لكن البنية التحتية

8:52

للذكاء الاصطناعي لم

8:53

تعد تعتمد على وحدة

8:54

معالجة رسومية واحدة

8:55

تتفوق في كل شيء، بل

8:56

على أنظمة مختلفة

8:57

تتفوق في مهام مختلفة.

8:59

إذا أردتم تعمقًا أكبر

9:00

في كيفية عمل UALink و

9:01

UltraEthernet فعليًا،

9:02

اتركوا لي تعليقًا،

9:03

ولا تنسوا الإعجاب

9:04

والمشاركة والاشتراك

9:05

في القناة. دعمكم

9:06

المستمر يساعدني على

9:07

الاستمرار في صنع

9:08

الفيديوهات. شكرًا

9:09

للمشاهدة. أراكم في

9:11

الفيديو القادم.

Interactive Summary

يقدم الفيديو نظرة شاملة على "هيليوس" (Helios)، وهو أول خادم ذكاء اصطناعي متكامل من شركة AMD، والذي يمثل تحدياً مباشراً لهيمنة Nvidia في هذا المجال. يوضح الفيديو أهمية بناء أنظمة "على مستوى الرف" (Rack-scale) حيث لا تعتمد الكفاءة على قوة وحدة المعالجة فحسب، بل على سرعة الربط والشبكات والبرمجيات المتكاملة. كما يتناول الفيديو استراتيجية الشركات الكبرى مثل OpenAI التي تتبنى استراتيجية مزدوجة: شراء أنظمة من AMD وNvidia، مع تطوير شرائح مخصصة "هالابينيو" لمهام الاستنتاج، مما يشير إلى تحول في البنية التحتية للذكاء الاصطناعي نحو أنظمة متخصصة لكل مهمة بدلاً من حل واحد شامل.

Suggested questions

2 ready-made prompts