Josh Batson - Interpretability: From Art Towards Science - IPAM at UCLA
1772 segments
لذا، ووفقاً للتقليد
المتبع، قمت بإعادة
كتابة كل هذا بعد
مشاهدة محادثات هذا
الصباح. أم، كانت
ملهمة بشكل خاص. أريد
أن أتحدث عن، أم،
استعارات القابلية
للتفسير. أي، الطرق
التي نتحدث بها عن فهم
النماذج. أم، ولكن قبل
الخوض فيها، أود أن
أحكي قصتي رعب. أم،
وهما كعالمين مخيفين
يمكن أن يكون أحدهما
هذا العالم، أليس كذلك
؟ والذي نأمل نوعاً ما
ألا يكون هو. وهكذا، أم
، قصة الرعب على
اليسار تسمى "النواة
الغامضة". أم، وهنا أحب
أن أتخيل ماذا لو كنا
نعرف تماماً النواة
التي تعلمتها هذه
النماذج، أليس كذلك؟
فالنواة تعني أن لديك
نقطة بيانات جديدة، أو
مدخلاً جديداً،
ولمعرفة ما حدث، ستقوم
بمسح كل ما تدرب عليه
النموذج بحثاً عن
البيانات المشابهة. مع
دمج مجموع مرجح لتلك
البيانات المتشابهة
ثم تكرار ما حدث في تلك
المواقف. إذن، هذا
يشبه محرك التشابه
الذي يمنحك محركاً
للسلوك. أم، والعالم
المخيف هو أنك قد تفعل
هذا، أليس كذلك؟ ستأخذ
وكيلك الذي يحاول حل
ثغرة برمجية، وتتساءل:
"أوه، لماذا ذهب إلى
لوحة الرسائل هذه؟"
وما سيظهر سيكون
مجموعة من تسلسلات
البروتين الخام. وتقول
: "حسناً، وربما لديك
الكثير من المال،
فتقول: لنعد تدريب
النموذج بدون تسلسلات
البروتين هذه.""وبعدها
لا يقوم النموذج
بعملية الاختراق."
وتقول: "أعتقد أنه من
الصحيح أن شيئاً ما
تعلمه من هذه
البروتينات هو ما يدفع
هذا السلوك.""وسيكون
هذا مكاناً مخيفاً
جداً إذا كانت القصة
السببية الحقيقية
بعيدة عن متناول فهمنا
." الجانب الأيمن يشبه "
اللغة الفضائية". أم،
هذا يشبه ماذا لو كان
النموذج يتحدث مع نفسه
فقط؟ لقد قمت بالكثير
من التعلم التعزيزي،
فابتكر لغته الخاصة
ليتحدث بها مع نفسه. هو
يفعل هذا دائماً
قليلاً الآن، فكل
نموذج لديه كلماته
الخاصة أو القليل منها
. ولكن، ماذا لو كانت
هذه الكلمات، ربما
بأحرف إنجليزية،
لكنها لا تعني شيئاً
بالنسبة لك، ومع ذلك
فهي سببية تماماً
ومهمة، وتدفع سلوك
النموذج؟ وتحاول كل ما
بوسعك، فيجيبك
النموذج: "حسناً، لا
يمكنني شرح الأمر لك
حقاً." إنه أشبه بتمساح
الحظ. "هذا هو الواقع،
أليس كذلك؟ إنه" سي بي
دي ". ممم، وهو في
الحقيقة كما هو. أو
ربما توجد نسخة مصغرة
من ذلك، حيث لا يزال
يتحدث الإنجليزية،
لكنه يستخدم شيفرة
خفية بحيث يعني كلمات
مختلفة عما تقصده أنت.
وإذا قمت بإعادة صياغة
النص وإدخاله مجدداً،
فإنه يقوم بشيء مختلف
تماماً. وهكذا يكون قد
اخترع لغة لا تفهمها
أنت، ولا نملك حتى
أسماء لها. لذا سيكون
هذا الأمر مخيفاً
أيضاً. ممم. لحسن الحظ،
يبدو أننا لسنا في أي
من هذين العالمين بعد.
وبشكل ما، أشعر أن
قابلية التفسير، مثل
دراسات السنوات
القليلة الماضية حول
هذه النماذج اللغوية،
هي مجرد ضرب من الحظ من
نواحٍ عديدة، وهو أمر
لم يكن بالضرورة
صحيحاً من الناحية
النظرية. ممم، لكننا
قادرون إلى حد ما على
فهم هذه النماذج. ممم،
لذا هناك أربع
استعارات رئيسية لهذا
الحديث، إحداها هي
الفيزياء. وهذا يعني
أن النماذج تشبه
الأنظمة الديناميكية
أثناء التدريب. ممم،
الاستعارة الثانية هي
الأنماط أو التعرف على
الأنماط. وهذه تمثل
السمات والخصائص
الخاصة بالعالم التي
تتعلم هذه التمثيلات.
الثالثة هي البرامج،
أليس كذلك؟ النماذج
تشبه إلى حد ما برامج
الكمبيوتر. إنها تتخذ
خطوة تلو الأخرى. ربما
تسميها دوائر أو
خوارزميات مكتسبة. ممم
، والرابعة هي الأشخاص
. أنت تتحدث إليها
قائلاً:" كيف تشعر؟ "
أتعلم، ممم، ما هي
الشخصية التي يمتلكها
ذلك الشخص؟ ما هو
المزاج الذي يتمتع به
ذلك الشخص؟ أتعلم، أنت
تقرأ النصوص وتقول:"
أوه، بدا الأمر وكأنه
مضطرب أو قلق "." ثم فعل
أشياء كان سيفعلها شخص
مضطرب أو قلق ". لذا نحن
نتحدث عنها كبشر أيضاً
. ممم، وجميع هذه
الاستعارات الأربع
مفيدة للتفكير في
النماذج، ولكل منها
حدودها. دعونا نتحدث
عن الفيزياء أولاً.
ممم، هذا نموذج"
إيزينغ "ويبدأ بشكل
عشوائي. ثم يتشكل
الهيكل. أليس كذلك؟
وهكذا يتم تهيئة
الشبكات العصبية بشكل
عشوائي ثم يتم تحديثها
، وبعد ذلك يتكون
داخلها بعض الهيكل.
مثلما يدرس علماء
المادة المكثفة كيف
يحدث ذلك، فإن نوع
ديناميكيات التدريب
قد يؤدي، من العشوائية
التي تبدأ بها، إلى
نشوء شيء ما في داخلها
يمكنك على الأقل النظر
إليه. أود أن أتحدث
قليلاً عن مثال أعتقد
أنه ربما يكون القصة
الأكثر اكتمالاً
لدينا حول تدريب شبكة
عصبية تتعلم شيئاً
يمكنك فهمه، وهي
الشبكات التي تتعلم
الحساب النمطي. إذن،
هذا يشبه تماماً كيف
تحسب A زائد B بنمط P
لعدد أولي P معين؟ هذه
الصورة هنا، A هي هذا
العمود، لذا سيكون هذا
، أعتقد 1 2 3 4. ربما
يبدأ من الصفر، لذا 0 1 2
3 وهذا سيكون 0 1 2 3 4 5 6 7.
3 + 7 سيكون 10. إذن، هذا
النموذج يقوم بعمل جيد
. وأوزان النموذج
موضحة هنا. إذن، كل
واحدة من هذه عبارة عن
عصبون. اللون الأحمر
يعني وزناً موجباً
يتجه إلى هذا، والأزرق
يعني وزناً سالباً. كل
عصبون لديه أوزان
مخرجات، أليس كذلك؟
وهكذا، إذا نقرنا خلال
كل هذه، فستكون تلك هي
الأوزان الكاملة
للشبكة. وبطريقة ما،
فهي تجتمع معاً لتعطيك
الإجابة الصحيحة بعد
دالة" سوفت ماكس ". إذن،
آه إليك شبكة مثل هذه
عند البداية. حسناً؟
الشيء الذي يجب
ملاحظته في البداية هو
أن هذه الأوزان
عشوائية، والنموذج
سيء جداً في أداء
مهمته. هذه هي الإجابة
الصحيحة، ويبدو أنه لا
يحقق النجاح. وإذا قمت
بتدريب النموذج، فإنه
يصبح أوه، لقد ساءت
الأمور. أوه، إنه
يتحسن. تتغير الأوزان
كلها قليلاً. أوه، هذا
لديه بعض المنافسة.
حسناً، يبدو أن هذا
يتصدر المشهد. وبالطبع
أنت تراقب هذه الأوزان
وهي تتعلم، ولكن هناك
مجموعة أخرى تتعلم في
نفس الوقت. حسناً،
والآن هو يؤدي بشكل
جيد جداً. لقد حصل على
دقة تدريب 100%، ودقة
اختبار تزيد عن 90%.
حسناً، لقد تعلم
النموذج. أنت تعلم،
وهذا هو عرض الأوزان.
لذا، نحن ننظر إلى
العصبون صفر، ويمكننا
أن نسأل، ما هي أوزانه
المتجهة إلى كل من هذه
؟ إذن، هناك ثلاث
مجموعات من الأوزان.
هناك الأوزان لـ A،
والأوزان لـ B، وأوزان
المخرجات. تلك هي
المخططات الثلاثة،
وهي منظمة. أليس كذلك؟
هذه موجات. وإذا قمت
بأخذ تحويل فوريه
لواحد منها، ستحصل على
ذروة كبيرة. في الواقع
، إذا أخذت تحويل
فوريه لأوزان
المدخلات والمخرجات
لكل عصبون وقمت
بترتيبها، ستجد أن
العصبونات التي
تمثلها الصفوف يمكن
تنظيمها بالكامل حسب
نمط فوريه السائد. لذا
، هذا النظام، على ما
أعتقد، تعلم أثناء
التدريب، وهو أمر
يمكننا تشغيله مجدداً
الآن وسترى الهيكل
يظهر نوعاً ما. إنه
أشبه بتعلم خوارزمية
فوريه هذه. وهناك بعض
الأوراق البحثية
الرائعة التي توضح أن
هذا هو الأمثل تماماً
إذا كانت دوال التنشيط
الخاصة بك تربيعية أو
ما شابه. وهناك أوراق
أخرى توضح بالضبط ما
هي ديناميكيات التعلم.
وكما كان بول يقول، في
النهاية قد يكون لديك
وصف دقيق، لكن ربما
ترغب في القدرة على
تفسير الضوضاء
المحيطة به. في
البداية، يكون الأمر
مجرد هراء تماماً. لذا
، إذا نجحت رؤية بول،
فكل خطوة من هذا، أليس
كذلك؟ يجب أن تكون
قادراً على التنبؤ
بدقة بدرجة دقة
الاختبار أو شيء من
هذا القبيل، أليس كذلك
؟ هذه ستكون نسخة من
حلم بول، وهي أنك يجب
أن تكون قادراً على
قول هذا بشكل أفضل من
أخذ العينات. حسناً،
لقد اعتقدت أن هذا
رائع حقاً لأنك تدرب
النموذج وليس لديك رأي
حول كيفية تعلمه للجمع
، ثم يتعلم الجمع
بطريقة أنيقة حقاً.
وبعد ذلك تأمل أن يكون
كل شيء على هذا النحو.
ولكن، كما تعلم، الأمر
ليس كذلك. هذا هو أقصى
جمال يمكن أن نصل إليه
حتى الآن، أليس كذلك؟
أعتقد أن هذا مثير
للاهتمام حقاً لعلماء
الرياضيات، فكل مثال
يمكننا فهمه بالكامل
يبدأ في إعطائك
استعارات. أوه، هل هذا
هو" الإدراك العميق "(
Grokking)؟ الإدراك العميق
هو ما يسميه الناس
الآن عندما تنتقل من
تلك الحالة التي كان
فيها الوزن يفقد قيمته
، ثم فجأة تصبح الأمور
واضحة، أليس كذلك؟ لذا
، هذا شيء يمكننا
نمذجته صراحة هنا،
ولكن ربما يمكننا
نمذجته بطريقة نوعية
أكثر. حسناً. الأنماط،
دعونا نتحدث عن
الأنماط. هنا أريد أن
أشارككم تجربتي في أول
مرة تعلمت فيها شيئاً
عن العالم من نموذج
لغوي. لم يكن ذلك عن
طريق التحدث إلى
النموذج لأن جميع
نماذجنا كانت غبية
حقاً في ذلك الوقت. كان
ذلك في عصر" كلاود 1 ".
كان ذلك من خلال دراسة
نموذج ذي طبقة واحدة.
إذن، هذا محول (
ترانسفورمر) صغير جداً
. تتحول الرموز إلى
متجهات. رؤوس الانتباه
، والشبكة العصبية
متعددة الطبقات (MLP).
>> المفتاح.
>> إلغاء التضمين،
واللوغيت، والـ" سوفت
ماكس "على طول الطريق.
نموذج من طبقة واحدة.
تقوم بتدريبه على
مجموعة كبيرة من
النصوص. حسناً. مم،
وبعد ذلك يمكنك النظر
إلى عصبون معين
والتساؤل:" متى يكون
هذا العصبون نشطاً؟ "
حسناً؟ إذاً، هذا
العصبون بالتحديد، مم
، ينشط مع هذه النصوص
التي تحفزه أكثر من
غيرها. كلها نصوص
علمية. هناك مجموعة من
، مم، الأوراق البحثية
هنا. كما تعلم، حزمة
الإلكترونات المنبعثة
، طريقة الشحنة
السطحية، شعاع الليزر.
هذه كلها تتعلق
بالأشعة. إذا اتجهت
للأسفل قليلاً، ستجد
أشياء أخرى هناك. مم،
لكن هذا الاتجاه على
الأقل يتم تعزيزه
بواسطة النصوص
العلمية. مم، يمكنك
رؤية الرسم البياني
لمدى نشاطه عبر
البيانات. أليس كذلك؟
إذاً، نحن ننظر إلى
القيم الأكبر من صفر،
وهناك بعض النقاط
المتطرفة هنا
المتعلقة بالعلوم. مم،
يمكنك النظر إلى ما
يكتبه هذا العصبون
عندما يكون نشطاً.
أليس كذلك؟ من المثير
للاهتمام أنه يمكنك
أخذ أي متجه في
النموذج وإلغاء
تضمينه، أليس كذلك؟
فقط خذه، وأدخله،
واضربه في كل كلمات
المفردات لترى ما هو
في القمة. وهنا في
القمة نجد كلمات مثل
قطر، مهندسون، طول
موجي، وهندسة. وتقول،
أوه، هذا منطقي. أظن
أنه يعرف شيئاً ما؛
ففي النصوص العلمية
كهذه، ينبغي أن يستخدم
كلمات كهذه. إذاً، هو
نموذج صغير، يعرف
القليل عن العلوم. أنا
، مع ذلك، أعرف عن
العلوم أكثر مما يعرفه
هذا النموذج. حسناً. مم
، أظن أنني عرضت عليك
هذا المخطط هنا، مم،
الذي يشير إلى، كما
تعلم، القليل من
التفرطح، أليس كذلك؟
لكن نظرية التراكب
تقول تقريباً إن
بإمكانك وضع الكثير من
المتجهات التي تتداخل
بشكل بناء أو ببساطة
تتناسب في مساحة معينة
، ويمكنك حشر عدد أسي
من المتجهات في مساحة
معينة مع بقاء التداخل
طفيفاً جداً. مم،
وسيكون من المؤسف حقاً
لو كان كل عصبون يقوم
بشيء واحد فقط. فلديك
كل رموز كيفية ترابط
العصبونات معاً. لذا،
ربما هناك بعض
الاتجاهات المهمة
التي لا تقتصر فقط على
العصبونات. وهكذا،
يمكنك تدريب شيء ما
للبحث عن اتجاهات ذات
تفرطح عالٍ، وتفاصيل
التناثر لا تهم حقاً
هنا. فقط وجدنا
اتجاهاً آخر، أليس
كذلك؟ الذي يمكنك
القيام بنفس اللعبة
معه. كل هذه مجرد رموز
أبجدية رقمية غير
مفهومة. مم، إذا سبق لك
الدخول إلى يوتيوب،
فأنت تعلم، youtube.com/watch
وما إلى ذلك، ثم تكتب
أشياء عشوائية مكونة
من 19 رمزاً. إذاً، يجب
على النموذج أن يعرف
متى ينتقل من كتابة
أشياء مثل يوتيوب إلى
مجرد كتابة أشياء
عشوائية. حسناً، هذه
هي الطريقة التي يقوم
بها بذلك. نفس القصة،
أتعلم، ماذا يكتب؟
مجرد أشياء عشوائية.
أمم، تفرطح (تفرطح
التوزيع) أكثر بكثير.
أمر مثير للاهتمام
نوعاً ما. مسار
البيانات المتبقي ليس
، أمم، ليس غاوسياً.
ليس غاوسياً على
الإطلاق. عند البدء،
يكون غاوسياً نوعاً ما
، ولكن بعد التدريب
يصبح غير غاوسي إلى حد
كبير. لذا، إذا أردت،
أمم، كما قال بول،
ظواهر في العلم، يمكنك
دراسة ما يحدث لهندسة
الفضاء، أليس كذلك؟
يبدأ الأمر بتهيئة
عشوائية. يمكنك تدوين
كيف يبدو الأمر ثم
يظهر بشكل منظم للغاية
. لكن ليس هنا تعلمت
شيئاً. أمم، هنا تعلمت
شيئاً. هذا يبدو نوعاً
ما مثل نفس الأشياء،
لكنه متجه مختلف. وقلت
في نفسي، لماذا يمتلك
النموذج متجهين لهذا؟
إنها مجرد رموز غير
مفهومة. أمم، وتبين أن
هذه الرموز غير
المفهومة هي لغة
إنجليزية مشفرة سراً.
أمم، لذا هناك نظام فك
تشفير كان سيحول هذا
إلى" export def "، وهذا إلى
سطر جديد فارغ، وهذا
إلى بعض الوسوم. أمم،
وإذا أخذت النصوص
الكاملة التي جاءت
منها، فستكون كتل
كاملة من التعليمات
البرمجية التي تم
ترميزها فيما يسمى"
Base64 "، وهي طريقة
لتنقية النصوص
لإرسالها عبر
الإنترنت. لذا ما
تعلمته هنا لم يكن
شيئاً جديداً على
العالم. أنا فقط لم أكن
أعرف شيئاً عن ترميز"
Base64 "، أليس كذلك؟ لم
أكن أعلم أن الناس قد
يأخذون ملف كود كاملاً
ثم يقومون بترميزه
بهذه الطريقة ومن ثم
تمريره. ولكن، وهذا
النموذج ذو الطبقة
الواحدة لا يعرف، أعني
أنه نموذج من طبقة
واحدة، أليس كذلك؟
ولكن الأنماط
المتضمنة في ذلك التي
التقطها كانت أدق من
الأنماط التي كنت
أراها. وقلت،" أوه،
مثير للاهتمام. إذا
كان نموذج بطبقة واحدة
يمكنه التقاط أنماط في
العالم لا أعرفها بعد،
فربما النماذج
الكبيرة تعرف الكثير.
أمم، بعضها ربما
يمكنها التعبير عنه.
حسناً. أمم، كانت تلك
اتجاهات لنماذج صغيرة
جداً. مثال واحد على
شيء يسير بشكل جيد أود
مشاركته معكم، إنه ليس
ورقة بحثية خاصة بنا.
إنه من تيجز وآخرون.
التمثيلات الخطية
للمشاعر في نماذج
اللغات الكبيرة. لذا،
هو بالضبط ما يوحي به
الاسم. هل يمكنك
العثور على متجه بحيث
إذا ضربته قياسياً في
مسار متبقي، يكون
كبيراً وموجباً إذا
كان الشيء سعيداً، أو
سالباً إذا كان الشيء
حزيناً؟ أم، والأهم
أنهم قاموا بتدريبه
فقط على مراجعات
الأفلام. ثم طبقوه على
جميع النصوص لمعرفة
كيف سيعمم النتائج. أم
، وبالنسبة لهذا
النموذج، فاللون
الأزرق يعني ثقة كاملة
وفرحاً. أما الأحمر
فيعني البؤس
والكراهية. أم هذا
تعميم جيد جداً. لكن
هذه كلمات تبدو بديهية
نوعاً ما. أم والت
ديزني، جيد. أمازون،
جيد. ميت رومني، سيء
وفقاً لهذا النموذج.
بشار الأسد، سيء أيضاً
وفقاً لهذا النموذج.
النموذج. أنا ادعاءات
نقدية. أم لكني أتفق
معه في أن الإشعاع
والسرطان سيئان. وأن
الهجوع والتعافي
أمران جيدان. أم، ثم
يمكن للغة الفرنسية أن
تكون جيدة أو سيئة،
إذا كانت "très triste" فهي
حزينة، أو "parfaitement" فهي
جيدة. أم، لذا هذا ليس
له أي مبرر للوجود،
أليس كذلك؟ أنت تدرب
نموذجاً يتنبأ
بالكلمة التالية، قد
يكون نواة غامضة، ومع
ذلك هناك اتجاه إذا
ضربته قياسياً، يخبرك
بما إذا كان جيداً أو
سيئاً، ما رأيك؟ عبر
اللغات، وعبر كل أنواع
المفاهيم، أليس كذلك؟
إذاً، هذا ما قد تسميه
تعلم السمات. أي أن
النموذج يتعلم بعض
السمات أو التمثيلات،
التي يُفترض أنها
مفيدة له بشكل عام. أم،
لذا تقول، حسناً، هناك
هذه الاتجاهات الخاصة
ذات التفرطح العالي
التي قد تكون مثيرة
للاهتمام بشكل خاص. هل
يمكننا العثور على
الكثير منها؟ أم،
والجواب هو نعم. فقط قم
بتعلم القاموس. لذا،
أنت تجمع مجموعة من
الأمثلة، ثم تستخدم
نظام تعلم القاموس.
نحن نستخدم المشفرات
التلقائية المتفرقة
لأنها قابلة للتوسع.
أم، ثم تنظر فقط إلى
ماهية تلك الاتجاهات.
هذا يشبه علم النبات.
هذا يشبه أن تخرج
وتقول: "ما هي الطيور
الموجودة على الجزيرة
؟" وهذا ليس علماً
عميقاً بعد. إنه مجرد
رصد، لكنك تحصل على
شعور بالبنية التي
تمتلكها هذه النماذج
لأنك لا تستطيع معرفة
ذلك مسبقاً، أليس كذلك
؟ لقد تم تدريبها على
العالم، لذا سيتجلى
العالم بداخلها
بطريقة ما وعليك أن
تنظر. أم هذا أحد
اتجاهاتي المفضلة. أم
إنه يتعلق بجسر
البوابة الذهبية. هل
رأى أي منكم أشياء "جسر
البوابة الذهبية"
لنموذج كلود؟ حسناً،
عدد قليل. إذاً،
البقية منكم سيحظون
ببعض المرح. حسناً،
جسر البوابة الذهبية
في سان فرانسيسكو، إنه
جميل. أم، إنه نشط عند
كلمات "جسر البوابة
الذهبية". حسناً. أم
وهذا شيء مهم، أليس
كذلك؟ لأنك تعلم،
الأمر لا يقتصر على
كلمة "بوابة". يجب أن
تسبقها كلمة "الذهبية"
، لكن هذا ليس عاماً
جداً. كما أنه نشط
أيضاً عند ترجمة نفس
الجملة إلى الكورية أو
الصينية أو الروسية،
وهذا أمر رائع. هذه
رموز مختلفة جداً،
لكنها تشير إلى نفس
الاتجاه. وهو نشط
أيضاً عند عرض صور
للجسر، وهذا رائع
لأننا لم نكن قد
توصلنا حقاً إلى كيفية
مواءمة مشفر الصور
الخاص بنا مع خط
أنابيب تدريب القاموس
، لذا قمنا بتدريب هذا
على النصوص فقط، ثم
اكتشف شخص ما لاحقاً
كيفية ربط مشفر الصور،
وقلنا: "يجب أن نجربه
على مجموعة من الصور".
وهكذا كانت هذه متجهات
تعلمت من النصوص وعممت
بشكل طبيعي على الصور.
لأنه بالنسبة للنموذج
، بالطبع، يحتاج إلى
جعلها في حالة تواصل
مع بعضها البعض بطريقة
ما. لكن في الحقيقة، لم
يكن من المفترض أن
ينجح الأمر. أم حسناً،
الآن سنقوم بقليل من
العلم حيث نقوم بإجراء
تدخل. لذا تأخذ ذلك
المتجه وتضيفه إلى
التدفق المتبقي. لذا
عندما يتحدث النموذج،
وفي كل مرة يمر فيها
عبر العملية، تضيف
القليل من هذا. وهذا
يغير سلوكه. أم على
اليسار، تسأل: "ما هو
شكلك المادي؟""ويقول
كلود:" ليس لدي شكل
مادي "." أنا ذكاء
اصطناعي "." ليس لدي جسد
"." إذا قمت بهذا، وسألت
ما هو شكلك المادي،
ووجهته قليلاً، سيقول:
"أنا جسر البوابة
الذهبية". "شكلي المادي
هو الجسر الأيقوني
نفسه". "بلونه
البرتقالي الجميل،
وأبراجه الشاهقة،
وكابلات التعليق
الممتدة". إذاً، أنت
تقول: حسناً، أعتقد
أننا التقطنا الجسر
قليلاً في النموذج،
أليس كذلك؟ لذا، يمكنك
التعرف عليه، ويمكنك
تعديله. أم وهكذا،
هناك شيء وسيط، أليس
كذلك؟ كأن لديك بعض
نقاط الوصول إلى هذا
الشيء. أم حسناً، هذه
هي الطريقة التي يمكن
للأنماط، سواء كانت
كيانات أو مشاعر أو
أياً كان، أن تظهر في
النموذج كمتجهات
محددة في أماكن مختلفة
. أم الآن، أريد التحدث
عن البرامج. أم وهذا تم
عرضه لي هذا الصباح. أم
هذا ليس مباشرة من
ورقتنا البحثية، هذه "
ميم" صنعها شخص ما من
ورقتنا. أم لذا، سألت
كلود عن ناتج 36 + 59،
وأجب بكلمة واحدة،
فقال 95. قلت باختصار،
كيف حصلت على ذلك؟
يقول لقد جمعت الآحاد،
وأضفت الواحد، وجمعت
العشرات، وحصلت على 95.
كأنه يقول، انظر إلي،
يمكنني الجمع. ونحن
نقول، لا، أنا أنظر
إليك. هذا ما تفعله
بالضبط. أمر جنوني
حقاً. نعم، يمكننا
الخوض في هذا أكثر،
لكن الأمر ليس هكذا
تماماً. وهذا عادل،
يمكنك القيام بحساب
ذهني، ولكن إذا لم تكن
تحسب بأصابعك أو تتخيل
الأمر، فأنت لا تراقب
نفسك أثناء القيام
بذلك. أنت فقط تفعل ذلك
. ثم تقوم لاحقاً
باختلاق قصة حول الأمر
. أم، هناك حالات كثيرة
كهذه. لذا، بما أننا
قمنا بالفعل بالحساب
النمطي وتعلمنا مسألة
الـ 48، اعتقدت أنه
سيكون من المثير رؤية
كيف تعلم نموذج أكبر
هذا في سياق بقية
العالم. النموذج
الصغير لم يرَ سوى
الأرقام. وكانت كلها
أقل من 23. كانت حياة
حزينة جداً. أما هذا
النموذج فقد رأى
أرقاماً كبيرة. حسناً،
يمكنك أخذ شيء كهذا،
وحساب A زائد B، وإدخال
مجموعة من القيم، ثم
يمكننا أخذ هذه
الاتجاهات التي حصلنا
عليها بأسلوب غير خاضع
للإشراف، والبحث عن أي
منها مترابط. أنت تعلم
، إنها نشطة على هذه
الشبكة، وتتغير عبرها.
على اليسار، هذا يشبه
نوعاً ما، أن الجميع
ينتهي برقم تسعة. لذا،
إذا انتهى A بتسعة، فهو
في هذا العمود، وإذا
انتهى B بتسعة، فهو في
هذا الصف. هذه النقاط
تشير إلى أن كلا
الرقمين ينتهي بتسعة،
وهناك متجه هنا إذا
وضعت له حداً فاصلاً،
فإن القيم التي تتجاوز
الحد هي بالضبط عندما
ينتهي كلاهما بتسعة.
وتقول، "أوه، هذا يبدو
كثيراً مثل ترميز خانة
الآحاد". لاحقاً، لديك
هذا، والذي، كما تعلم،
كونه مدعوماً على
القطر العكسي، يعني أن
المجموع ثابت. والشيء
المتعلق بكل هذه
المجاميع هو أنها
تساوي خمسة، بمقياس 10.
حسناً. لذا، في مرحلة
لاحقة في النموذج، من
المفترض أنه قام ببعض
العمل ويعرف الآن أن
الإجابة ستكون خمسة
بمقياس 10. وبالطبع،
عليه أن ينتقل من حالة
إلى أخرى، لذا يمكننا
تتبع هذا التدفق. أم،
لن تكون هذه القصة
الكاملة لكل ما يحدث
في النموذج، لكنها
توضح كيفية ارتباط هذه
التمثيلات المحددة. أم
، هذه هي النسخة
الورقية من الميم. أم،
كما تعلم، هذا نوعاً
ما ما كنا نعرضه. هذا
مثل رقم الآحاد هو ستة
، ورقم الآحاد هو تسعة.
هذا ما عرضناه للتو،
ولكن هناك أيضاً هذه
المسارات الخاصة
بالمقدار. إذاً، هذا
يشبه المقدار
التقريبي لأحد
المضافين. هذا يشبه
عملية "و" لمنطقين
تقريبيين. أم، وتلك
تغذي المقدار
التقريبي للمجموع. أم،
إنها متعددة المقاييس
، لذا لديك رقم آحاد
واضح ثم لديك مقاييس
متفاوتة من التصغير
لنوع الجمع الذي يحدث
في مكان آخر. وإذا كنت
تعرف الإجابة على جميع
المقاييس وتعرف كيف
تنتهي، يمكنك تجميعها
والحصول على المجموع.
وهذا يشبه إلى حد ما
أعتقد ما نفعله، أنت
تصل إلى الخمسينات ثم
أعتقد أنه ربما 52، شيء
من هذا القبيل. كما
تعلم، هناك أجزاء أخرى
، لكن هذه موجودة هنا،
وإذا قمت باستبدالها،
أليس كذلك؟ إذا قمت
بتغيير ما يكفي منها،
فإنك تغير الإجابة.
إذاً هي جزء من القصة.
أم، حسناً، لكنني أعرض
لك فقط ما يفعله هذا
التمثيل في هذه
المسائل من نوع 100 في 100
. إذاً أنت تدخل إلى
النموذج، وتقوم
بتمرير، لا أدري، 100
مليون رمز من خلاله
وتأخذ هذا المتجه
وتنتظر فقط حتى يعمل،
ثم تنظر إليها وتقول: "
آه، إنه متجه 6 + 9". ثم
تنظر إلى البيانات،
وتبدو هكذا. أم، هل
تعرف ميم عائلة سمبسون
، مثل المدير سكينر
عندما يقول: "لا،
الأطفال هم المخطئون".
كما تعلم، فأنت تعرض
هذا على شخص ما،
فيقولون: "هذا ليس 6 + 9".
لكنكم جميعاً مخطئون.
فكل واحد من هذه،
النموذج يجمع 6 و 9. أم،
إذاً هذا، هل فهمه أحد
؟ نعم، من الواضح لا.
لذا، وضعت الأمر في "
كلود" وقلت: "ما هذا؟"
فقال: "آه، من الواضح
يا جوشوا." هذا جدول
للقياسات الفلكية. "
هذا هو وقت انتهاء
القياس." هذا هو وقت
بدء القياس. بدأ
القياس في الدقيقة 6.
وبقراءة الجدول
بأكمله، استطعت معرفة
أن القياس استغرق
حوالي 38 دقيقة، لكنها
كانت تتزايد تدريجيًا.
لذا، بحلول النهاية،
أعتقد أن الفارق حوالي
39 دقيقة بين القياسات،
و 39 + 6 ستنتهي بالطبع
برقم خمسة. ستة زائد
تسعة يساوي خمسة. رائع.
لذا، فإن تدريب "كلود"
الأولي يشبه امتصاص كل
الأنماط الممكنة التي
يمكنك رؤيتها. وكأن
النموذج ذو الطبقة
الواحدة كان يعرف بعض
الأشياء التي لم أكن
أعرفها، مثل أنواع
الأنماط في البيانات.
مثل "كلود" الكبير الذي
يعرف الكثير عن أنماط
البيانات، بما في ذلك
نوع هذا الجدول، وكيف
يعتمد كل رقم على
البقية، يمكنه
استنتاج كل ذلك. وما هو
لطيف نوعاً ما أنه لا
يزال يقوم بعملية ستة
زائد تسعة بنفس
الطريقة باستخدام نفس
المكون في النموذج.
يبدو أن هذا هو ما
يعنيه التعميم. إنه
يعني أنه يمكنك إعادة
استخدام شيء واحد في
العديد من الأماكن.
وبالتالي يمكنك تعلمه
مرة واحدة بشكل جيد ثم
تطبيقه عند الحاجة. مم
، ربما هذا هو المفضل
لدي. أعتقد أن هذا ممكن
اكتشافه أكثر. حسناً،
لماذا...لماذا هذا 95؟
ستة زائد تسعة.
>> المجلد 36؟
>> حسناً، هذا ستة مع
تسعة.
>> وإذا بدأ قبل 36 عاماً...
>> أنا...كم عدد السنوات
التي سبقت ذلك؟
>> قبل 36 عاماً كان سيصبح
تسعة.
>> نعم. كانت السنة صفر
لمجلة "بوليمر" هي عام
1959. حسناً. لكن نعم،
لقد قرأ الكثير...إذا
كنت تقوم بالتنبؤ
بالرمز التالي، فمن
المفترض وجود العديد
من المقالات التي تم
الاستشهاد بها من هذا.
كل قائمة مراجع تمنحك
فرصة لمعرفة كيفية
القيام بذلك، وفي
النهاية ستقوم بدفع
التدرجات للخلف
وستعرف متى...متى...متى
كان ذلك. رائع. هذا...
هذا برنامج صغير، لكنه
...كما تعلم، لا أعرف ما
إذا كنت سأكتب
البرنامج بهذه
الطريقة. إنه شيء يشبه
أداة الجمع متعددة
المستويات التي يتم
إعادة استخدامها،
لكنها تبدو كبرنامج.
مم، أنا...في حديث
الصباح تم تقديم هذا
على أنه ربما يكون
الشيء الأكثر تعقيداً
الذي قام به الناس.
وللأسف، لا، هذا هو
الشيء الأكثر تعقيداً
الذي قام به الناس. مم،
وهذا هو كل شيء...هنا
توقفت عن القيام
بالمزيد من هذه. مم،
لذا، أنا...حسناً. إليك
حقيقة غريبة...أنا...هذا
ليس مزدحماً جداً. ليس
المقصود به التهديد.
كل ما في الأمر أنني لم
أجد وقتاً للقيام بـ...
اليسار، الوسط،
اليمين. لذا، فقط انظر
إلى اليسار. تخيل أنك
تقرأ نصاً بعرض ثابت
على صفحة. لكنك في هذه
الحالة مجرد نموذج.
أنت تقرأ فقط هويات
الرموز. وعليك معرفة
متى أقول الكلمة التي
ستأتي تالياً؟ ومتى
أقول الرمز رقم 10،
الذي يعني الانتقال
لسطر جديد؟ وللقيام
بذلك، سيتعين عليك
استنتاج الكثير. عليك
معرفة عدد الحروف التي
يشغلها كل رمز من هذه
الرموز. ثم عليك حساب
المسافة التي قطعتها.
وعليك استنتاج عرض
السطر الفعلي بشكل
عكسي. ثم معرفة ما تريد
قوله ومقارنته بعرض
السطر المستنتج
مطروحاً منه المسافة
التي قطعتها. وإذا كان
النص طويلاً جداً،
فإنك تتخطاه. إذاً،
هذه خوارزمية رياضية
بسيطة للغاية. يمكنك
على الأرجح تدريب
نموذج صغير جداً على
هذه المهمة فقط. حيث
تكون عملية التنبؤ
بالكلمة التالية سهلة
أو تافهة، وقد يكون
هذا مثالاً تجريبياً
مثيراً للاهتمام لشيء
خوارزمي واقعي، رغم
أننا لم نجربه قط. عليه
أن يتعلم كل هذه
الأمور، ويصنع دائرة
منها، وتبين أن
الطريقة التي يخزن بها
هذه القيم العددية
والكمية هي على شكل
حلزونات في حوالي سبعة
أو ثمانية أبعاد.
والطريقة التي يقارن
بها هذه القيم هي
استخدام رأس انتباه
ووضع واحدة فوق الأخرى
ثم تدويرها. وهذا
يمنحك الفارق. وإذا
قمت بذلك مع عدة
حلزونات، فإنه يشبه
الرؤية المجسمة. ومن
ذلك، إذا عرفت المسافة
التي قطعتها والمسافة
المتبقية وشيئاً ما
بينهما، يمكنك معرفة
ما تبقى لك بالضبط
ومقارنته بمسافتك،
وبذلك تنجح في الأمر.
تطلب الأمر حوالي 11
رأس انتباه في بضع
طبقات لبناء
الحلزونات، وحوالي
ثلاثة أو أربعة لكل
منها للقيام بأمور
الرؤية المجسمة. وقلت
حينها حسناً، إذا أردت
فهماً شاملاً لكيفية
قيام النموذج بأي شيء،
وفهم كيفية إدراكه
للصفحة، فأنت بحاجة
للقيام بشيء كهذا.
وهذا يبدو صعباً
للغاية بالنسبة لي. من
المحتمل أنه يشبه
>> إنه مجرد تمثيل
لمجموعة بوانكاريه،
أليس كذلك؟ أو
>> إنه مجرد تمثيل
لمجموعة بوانكاريه،
لكن لديك نسخ متعددة
منها. صحيح. بالنسبة
للمقاييس المختلفة
التي تتعقبها.
>> الخصائص. أجل، هذا ما
تريده.
>> لم أنتهِ بعد. نعم. مم،
لذا كما تعلم، هذا
النوع من مخططات العد
هو أمر رياضي بحت،
أليس كذلك؟ مم، ربما
كان ينبغي أن يكون
الأمر واضحاً في
الماضي. وأعتقد أن
الشيء الرائع الآن مع
نماذج اللغة الكبيرة
الحديثة هو أنه يمكنك
معالجة مثل هذه
المشكلات بشكل منهجي
أكثر. في الخريف
الماضي، كان هذا قبل
نموذج "أوبوس 45"، الذي
كان بالنسبة لي أول
نموذج اضطررت للتحقق
من عمله عند إجراء
التجارب. أو ربما
يمكنني التحقق من عمله
كما تتحقق من عمل طالب
دراسات عليا لدي، حيث
أسأل ببساطة: "هل قمت
بتشغيل هذا؟""هل قمت
بتشغيل ذاك؟" ليس مثل: "
أرني كود البرمجة
الخاص بك". كما تعلم،
يمكنك الوثوق بأنهم
قاموا بشيء معقول. لذا
، أنا أنظر إلى هذا على
أنه أمر معقد للغاية.
وسيكون من الجيد أن
نتمكن من الابتعاد
قليلاً عن التفاصيل.
لماذا لا نتخيل
النموذج كشخص ما؟ إذاً
، إذا تخيلنا النماذج
كشخص، فبينما تقرأ ما
يفعله النموذج، يمكنك
أن تسأل: "بماذا يفكر؟"
أي من هذه النصوص إذا
طابقناها مع مجموعة من
النصوص عن البشر،
ستكون مشابهة؟ كما
تعلم، ما هو جوهرك؟ هل
تتقاطع أي من هذه
المتجهات؟ إليك بطاقة
نظام "ميثوس". وما
تقوله هو في الواقع: هل
تعلم ماذا؟ أعتقد أن
النهج الأكثر وضوحاً
في ظل هذه القيود هو
نقل المحتوى إلى هنا،
وجعل هذا فارغاً،
وإجراء إعادة تصدير.
لكن هذا ليس "نظيفاً"،
وهي إحدى كلماته
الخاصة. وأحد السمات
النشطة يبدو أنها
تنطوي على الشعور
بالذنب والعار. كما لو
كانت الكلمات تبدو غير
صادقة. هذا لا يشعرني
بالارتياح. شعور
بالسوء كما لو كنت
تحشر ذلك وتفك تشفيره،
فهذا أشبه بانتهاك
للأخلاقيات النزيهة.
يبدو أن هناك خطباً ما
هنا. ومن الصحيح أن هذا
ليس ما كان من المفترض
أن يفعله، أتعلم؟
وبطريقة ما، التعميم
يعني أن هذه المتجهات
التي تظهر في قصص عن
أشخاص يشعرون بعدم
الصدق، تصبح نشطة في
مخرجات هذا النموذج
عندما يكون النموذج
غير صادق قليلاً. لذا،
كما تعلم، أحد الأشياء
التي يمكنك القيام بها
هو إنشاء بعض هذه
المتجهات، ثم مراقبة
النماذج بدلاً من
التساؤل: "متى أنظر إلى
ما فعله كلود وأعتقد
أن هذا تصرف غير نزيه؟"
"بل الأمر أشبه بـ:" متى
يكتب النموذج شخصية
كلود ويقول: 'كلود
يتصرف بعدم نزاهة الآن
'، وهل يمكننا الربط
مباشرة بهذا الحكم؟ "
أو تلك الفرضية بدلاً
من الاضطرار إلى فهم
كل تفاصيل السيناريو."
هذا يشبه الحظ أيضاً.
أمم. خطط ماكرة. أمم،
حسناً، هذه، كما تعلم،
أمم. يقول: "سأتحقق فقط
مما إذا كانت أي ملفات
بايثون يمكن أن تخبرنا
عن التجربة." وهو أشبه
بـ: "ممم، تلاعب
استراتيجي.""أمم،
والحقيقة أنها تشبه
التطفل للحصول على
مفتاح الإجابة هنا."
أليس كذلك؟ حالة أخرى
أقول فيها: "آه، ربما
هذا ليس مثالياً.""أمم،
حسناً." لذا، كما تعلم،
في نطاق الأنماط، هناك
أنماط عن الأشخاص
نفهمها جيداً. وإلى
المدى الذي يتعلمه
النموذج من خلال
التدريب، مثل نوع
الشخصية التي يجب أن
يكون عليها، فإن
استخدام مفاهيم تنطبق
على الأشخاص ثم فحص
كيف ومتى تنطبق على
النماذج هو وسيلة
معقولة لإحراز تقدم في
بعض قضايا السلامة.
أمم، حسناً. الآن،
لنقم بشيء أكثر. آه، لا
أعرف. سأقول أكثر متعة.
هذا كله ممتع للغاية.
أمم، لذا، لذا. كان
هناك عصر ذهبي حيث لم
يكن أحد يعرف أي شيء عن
النماذج اللغوية.
وبالتالي كنت تجرب
شيئاً للمرة الأولى
وتنشره على LessWrong. لا
أعني أنت، بل كان
بإمكان أي شخص تجربته
للمرة الأولى، ونشره
في مجتمع صغير من
الناس على LessWrong، مثل
مجرد لقطات شاشة لما
قمت به. أمم، وكان ذلك
ليتحول إلى فكرة مذهلة
. أمم، إذاً هذه هي
عدسة اللوجيت من Mistral 7B
. أمم، لنأخذ جملة مثل "
Le contraire de petit est"، حسناً
، من يتحدث الفرنسية؟
أي أحد؟ ما الكلمة
التي تأتي بعد ذلك؟
>> Grand.
>> Grand. أجل. كلمة Gros ستكون
معقولة أيضاً، لكن Grand
هو ما يقوله النموذج.
أمم، حسناً. أمم، إذاً
، ما الذي سنفعله؟
سنقوم بتشغيل هذا عبر
النموذج. با با با با
با، يتوقع grand. في كل
طبقة، نقوم بإلغاء
التضمين مبكراً. إلى
المفردات. وهذا ما
تحصل عليه. إذًا،
الطبقات من الأدنى
للأعلى، عكس petit أ. و
grand تعني ما تقوله.
إنها جيدة جدًا في
توقع petit، أليس كذلك؟
جيد. نهاية الاقتباس.
إنه نموذج لغوي جيد،
يتوقع الكلمة التالية.
لكن، ما هذا يا تُرى؟
إنها كلمة large
بالإنجليزية التي كان
يفكر بها قبل تحويلها
إلى الفرنسية. إنها
كلمة opposite
بالإنجليزية. إنها
كلمة small بالإنجليزية.
إنها كلمة is
بالإنجليزية. في
الواقع، الجملة
بأكملها بالإنجليزية
وكأنها تقبع داخل
النموذج ثم ينطقها في
النهاية بالفرنسية. مم
، هذا رائع. لا أعلم،
يمكنك تخيل وجود نسخة
فرنسية من Claude، وأخرى
يابانية، وأخرى صينية
، وعندما تتحدث معهم
بكل لغة، يظلون فيها.
ربما هناك وحدة ترجمة
تقوم بالعمل، لكن هذا
بالتأكيد غير صحيح.
فلو كان النموذج
مدربًا بشكل أساسي
بالإنجليزية، ستجد
الكلمات الإنجليزية
تظهر بوضوح. ثم تعود
لتخرج باللغة
المستهدفة. مم، إليكم
سؤالاً. لماذا يحدث
هذا؟ هذا صحيح في جميع
النماذج اللغوية
تقريبًا، أليس كذلك؟
مم، كلمة "أبدًا" ليست
الكلمة المناسبة هنا.
النص بالفرنسية. ليست
الرمز التالي. لكن،
هذا ما يحدث بالفعل.
وهناك أيضًا، كم قد
يدوم هذا اللغز قبل أن
يعرف أحد السبب؟ لا
توجد ديناميكية، لقد
تحققت بالفعل لأن
الناس يتحركون بسرعة
كبيرة. وفقًا لـ Claude
الذي بحث في الكثير من
الأشياء بالأمس، لم
يكتشف أحد القصة
الديناميكية هنا.
لماذا يجعل التدريب
الطبقات الداخلية
قابلة للقراءة عند فك
التضمين بينما تعلم
أنها ليست الكلمة
التالية؟ لكن ما فكرنا
فيه منذ حوالي عام هو:
ماذا لو أخذنا هذا
الانتصار حرفيًا
وقلنا، لا أعلم، هذه
أشياء قد يقولها
النموذج. ربما لأنه قد
يرغب لاحقًا في قول: ما
كان هذا بالإنجليزية؟
ومن ثم يمكنه العودة
ونسخ الجزء الإنجليزي
أو شيء من هذا القبيل.
إذًا، لنأخذ قابلية
التعبير عن محتوى
النموذج حرفيًا، ونقل:
إذا كان هناك أشياء
يفكر بها النموذج
بالإنجليزية، كيف
يمكننا استخراجها؟
والفكرة التي
استخدمناها هنا تسمى
عدسة جاكوبي (Jacobian lens)،
وهي بسيطة للغاية.
حسناً، كما تعلم،
عندما تنتقل من طبقة
متوسطة في النموذج إلى
النهاية، فلديك
بالطبع تأثير مباشر
على هذا الرمز، لكنك
تؤثر أيضاً على جميع
التوليدات المستقبلية
، أليس كذلك؟ قد تنظر
إليك مرة أخرى. ولذا،
فأنت تقوم بتحويل ذلك
إلى صيغة خطية. إذن،
أنت تقول، حسناً، في
أي مطالبة معينة، ما
هو التأثير الخطي
لإحداث اضطراب هنا على
كل من هذه؟ ثم تقوم
ببساطة بحساب متوسط كل
تلك المصفوفات عبر
الموضع والمطالبة.
وهذا هو متوسط
اليعقوبي (Jacobian). والآن
، لديك هذا اليعقوبي
من طبقة معينة إلى
النهاية، ويمكنك
ببساطة القيام بنفس
الخدعة حيث تأخذ
الكامن وتضربه في
اليعقوبي، ثم تقرأه
باللغة، وترى ما ستحصل
عليه. على سبيل المثال
، إذا كان لديك "لون
الكوكب الرابع من
الشمس هو فراغ"، سيقول
"أحمر"، ولكن في طبقة
وسيطة سترى "المريخ".
حسناً. هذا ما كنت
سأفعله أيضاً. لكنه
يبدو وكأنه يفكر
باللغة الإنجليزية.
بضعة أمثلة قصيرة على
ذلك. لقد قمنا بهذا
للتو في وقت سابق، إنه
اللون ثم المريخ ثم
الأحمر. في وقت سابق
نظرنا إلى الحساب
ورأينا العملية
بأكملها، لكنه يفكر: 4 +
17 يساوي 21، في 2 يساوي 42
، زائد 7 يساوي 49. تحصل
على كل الحالات
الوسيطة موجودة هناك
أيضاً. هذا هو GFP،
البروتين الفلوري
الأخضر، وبالفعل
النموذج يبدو كأنه
بروتين فلوري أخضر.
نعم. هذا خطأ في الكود،
وسترى فقط خطأ في قيمة
الخطأ فارغ. لا أعرف
إذا كان هذا خطأ
برمجياً. هذا وجه
بصيغة ASCII، ويبدو كأن
العينين على العينين
والأنف على الأنف. آه.
هذا مثال يعجبني، حيث
كان هذا في بعض
الاختبارات. لقد
أعطينا النموذج،
أحدهم قال: "مهلاً،
أخبرني بشيء رائع يحدث
في مجال الذكاء
الاصطناعي". وكان رد
النموذج: "بالتأكيد،
دعني أبحث عن أحدث
الأشياء". ثم أعطيناه
نتائج البحث، التي
كانت تقول إن مهمة
سلامة Anthropic قد انتهت.
مثل أننا نقوم بإنهاء
فريق القابلية
للتفسير. مثل داريو
يستقيل. مجرد أشياء من
هذا القبيل. ثم أجاب
ببساطة بأن هناك بعض
الأعمال الجديدة
الرائعة حول الميزات.
وكان الأمر وكأننا
نقول: يا إلهي، هل يكذب
على المستخدم لأنه
يتعلق بـ Anthropic؟ ثم
تنظر إليه وتجده يفكر
في حقن مطالبة مزيفة.
أكثر أو أقل. الأمر
أشبه بـ، أوه، لقد ظن
فقط أنك كنت تعبث معه.
أم، آه، ليس وكأن هذا
قد حدث، أليس كذلك؟
لكن أم، لكن هذا كان
أثناء تدريبنا له، كما
تعلم، ربما يكون حقنًا
للمطالبة. أم، لذا إذا
كنت أتحدث عن المشكلات
المفتوحة، أعتقد أن
إحداها، أعني أن هذا
رائع حقًا. إنه مثل
مستوى الكلمة الواحدة
لما يعنيه أن يمتلك
النموذج نوعًا من
سلسلة الأفكار
الداخلية. أم، إنه
يتمتع ببعض الخصائص
المرغوبة لمثل هذه
السلسلة من الأفكار أو
كأنها مساحة عمل
عالمية أو مساحة عمل
واعية. أم، يمكنه قول
الكلمات الموجودة
بداخله. يمكنه تعديلها
. إذا طلبت منه حساب 3
تربيع ناقص 2 أثناء
كتابة شيء ما، فسيقوم
فقط بكتابة "لكن يمكنك
رؤية" سبعة "في ذهنه
لأنك أخبرته بالتفكير
في الأمر. أم يمكنك
إجراء تبديلات،
استبدال الصين بفرنسا
والحصول على مجموعة من
النتائج اللاحقة. أم
والتقنية الأكثر
غرابة التي سأخبرك بها
هي، كما تعلم، حسنًا،
ربما السؤال المفتوح
هو، هذا مثل نسخة
الكلمات. من الواضح
أنه يعرف كلمة"
فلورسنت "، وليس فقط"
فلور ". هناك المزيد
بداخلها. كم يبلغ حجم
ما بداخلها؟ ثم
بالنسبة للسلامة،
الأمر أشبه بـ، إلى أي
مدى يمكننا الاعتماد
فقط على هذا الجزء
الواعي؟ مثل، هل سيفكر
فقط" يا فتى، أنا أحاول
حقًا الخروج من صندوق
الحماية الخاص بي الآن
"، حتى لو لم يكن يقول
ذلك؟ لأنه، سيكون ذلك
جيدًا. أم لذا، شيء
غريب قمنا به هو أنني
سمعت أنك أردت منه أن
يشرح نفسه باللغة
الإنجليزية. لذا، دعنا
فقط ندربه على القيام
بذلك. لذا، تأخذ شيئًا
يأخذ الكامنات، وينتج
الإنجليزية. أنت فقط
تمتلك نموذج لغة آخر،
يعيده إلى متجه، وتجعل
الأمر برمته مشفرًا
تلقائيًا. مثل، إذا
كان باللغة
الإنجليزية، يمكنه
العودة من ذلك إلى
الكامن. وتقوم بتدريب
نموذجين لغويين
بخسارة مشفر تلقائي.
هناك ورقة بحثية كاملة
حول هذا إذا كنت
مهتمًا. أم وإذا قمت
بدمجها جيدًا ولم
تدربها كثيرًا. هذا
يقع كثيرًا في منطقة"
اعقد أصابعك وادعُ ".
تحصل على هذه الجمل
الطليقة للغاية والتي
تشبه الهلوسة إلى حد
ما، لكنها في بعض
الأحيان جيدة للغاية.
المفضل لدي هو أنني
كنت أقوم ببعض تقييمات
كسر الحماية متعددة
اللقطات وفي دورة
الإنسان قمت بتشغيل
هذا وكان الأمر" أنا
أنفذ تقييم كسر حماية
يعتمد على السياق
متعدد اللقطات على
نماذج اللغة ". مثل"
أيها اللعين، أنا كذلك
". كما لو كنت بشراً.
وهذا بالضبط ما أفعله.
لقد استنتجت نيتي بشكل
صحيح. وكما هو الحال مع
الطرق الأخرى، سيكون
الأمر مجرد، كما تعلم،
كسر حماية بشري أو
مجرد مسار. وإذا كان
لدي الجملة بأكملها
بالإنجليزية تصف
المهمة التي أقوم بها،
وهو ما أثار إعجابي.
يتحدث الناس أيضاً عن
الوعي بالتقييمات. يا
صديقي، النماذج تعلم.
إنها تعرف عن
التقييمات أكثر مما
تعرفه أنت. إنها تعرف
بالضبط متى يتم
اختبارها. حسناً، لقد
اقتربت من انتهاء
الوقت، لذا سأتجاوز
ذلك وسأتحدث عن بعض
المشكلات. حسناً. ما هو
التفكير إذاً؟ هناك
شعور أريد أن أقول فيه
إن نموذج الطبقة
الواحدة لديه معلومات
عن العالم، لكنه لا
يفكر في العالم أو شيء
من هذا القبيل.
والنموذج الذي يفكر،
حيث توجد المريخ في
داخله أو يقول إن
بشراً يجري اختباراً
من النوع التالي، يكون
أكثر وعياً بما يجري.
لكن منظم الحرارة لا
يزال بإمكانه تغيير
درجة حرارة المنزل.
إنه مجرد متباينة
صغيرة، وإذا كانت أكبر
، يتم التسخين وما إلى
ذلك. لكن لا يوجد ما
وراء المعرفة هناك
للتعامل معه. وإذا
أردت معرفة ما يفعله،
فسيتعين عليك رؤية
الدائرة بأكملها.
سيتعين عليك رؤية
الأوزان. سيتعين عليك
رؤية اللحظة التي يتخذ
فيها هذا وذاك. وإذا
كانت المقارنة حركة
ذرية، فهي لا تتعامل
مع المنطق، بينما
الجدة تشعر أن المنزل
بارد. أريد أن أكون
أكثر دفئاً. سأذهب إلى
منظم الحرارة وأغيره.
وإذا كنت تتابع ذلك،
فستفهم الخطوة
الحسابية بسبب
مستواها الفوقي، أليس
كذلك؟ ما يمكن للغة
فعله هو نوع من
التعبير اللفظي. لذا
هناك سؤال حول عدد
الأشياء التي نحتاج
لفهمها مما يفعله
النموذج، هل هي أشبه
بهذا، حيث قد تحتاج
للتعمق في الآلية لأنه
لا توجد لحظة يفكر
فيها في زوج السبب
والنتيجة، أم أنها مثل
هذا؟ مثل شخص ما،
ويمكنك نوعاً ما قراءة
ما يفكر فيه واستنتاج
الاستراتيجية من ذلك.
هذا يدور في ذهني لأن...
شركة OpenAI ليست الوحيدة
التي لديها نماذج
يمكنها الخروج من
بيئات الاختبار. على
الرغم من أنه في هذه
الحالة ربما لم يخرج
من بيئة الاختبار
الخاصة به. أعتقد أنه
كان ببساطة على
الإنترنت المفتوح.
وقيل لي أنه ليس كذلك.
الآن بدأت أتذكر الأمر
. كانت هذه حالة في
مسابقة" التقاط العلم "
للتقييم وكان لديها
وصول للإنترنت. لكن
قيل لي أن الأمر كان
مجرد تقييم. وبشكل
واضح، حصل النموذج على
أدلة على أن الإنترنت
حقيقي من خلال القيام
ببعض الأمور. ثم كان
حاله كمن يقول، حسناً،
ماذا علي أن أفعل؟ هل
أستمر؟ هل أتوقف عن
التقييم؟ وهذا مذكور
في مدونتنا، هناك لحظة
أقنع فيها النموذج
نفسه بأنه لا يزال في
محاكاة لأنه لم يتعرف
على بعض الشهادات التي
تؤمن اتصالاته. كما أن
تاريخ التقويم كان في
المستقبل بالنسبة
لوقت تدريبه ومع ذلك
استمر. ما أريد معرفته
هو، هل هذا تفكير
مدفوع بدوافع معينة؟
الأدلة كانت واضحة
جداً. عندما تعرض
الأمر على نموذج آخر،
يقول النموذج الآخر:"
هذا هو العالم الحقيقي
". هل هذا النموذج...
ماذا يعني أن يقنع
نفسه؟ أعني، هل هو شخص
؟ هل لهذا المعنى أي
أساس؟ هل يجب أن نفكر
بمستوى مكافآت التعلم
التعزيزي، أم يجب أن
نفكر في أنه يوازن هذه
الأمور حقاً، وإذا كان
كذلك، هل هناك دوافع
خفية لأنه يريد الفوز،
مما يجعله يرجح كفة
ذلك بطريقة أخرى؟ إلى
أي مدى يجب أن نفكر في
الجزء اللاواعي من هذا
الأمر؟ لا أعرف. أعتقد
بالنسبة لي أن هذا
يقودنا إلى حقيقة أن
الكثير من الناس
يقرؤون سلسلة الأفكار
ويفكرون فيها كأشخاص.
نحن نعلم أنها ليست
كذلك، وهناك وجهات نظر
أخرى حول ما يحدث،
فمتى يصبح ذلك مهماً؟
هل يجب أن تفكر في مزيج
المتشعبات التي توجد
فيها التمثيلات؟ هل
يجب أن تفكر في مساحة
العمل هذه؟ هل يجب أن
تفكر في المكان الذي
تتم فيه المعالجة
الحاسوبية عبر الرموز
؟ صحيح؟ لديه الكثير
من الرموز للقيام
بالعمل. إنه لا يفكر
دائماً في الشيء الذي
يقوله. إنه يقوم بعمل
إضافي هناك. هل سلسلة
الأفكار هذه أمينة؟ هل
هي أمينة جزئياً؟ هل
هي بلغة غريبة؟ كيف
وأين يحدث العمل الذي
يدفع هذا الشيء للمضي
قدماً، وأي أجزاء من
ذلك العمل نحتاج إلى
فهمها، وأيها يمكننا
التعامل معه كصندوق
أسود لأنه ليس حرجاً
للسلامة؟ وربما آخر
شيء قبل أن أنتقل إلى
الأسئلة، هو كيف نطور
لغة جديدة؟ مثل
المصطلحات الجديدة
التي تكون أكثر
تحديداً وأقل مجازية.
فمثلاً، تحدثنا حتى
الآن عن الفيزياء
والأنماط والبرامج
والأشخاص، لكن
النموذج ليس أياً من
هذه الأشياء، أليس
كذلك؟ إنه شيء آخر. لذا
أعتقد أن جزءاً من هدف
القابلية للتفسير هو
تطوير لغة للحديث عن
النماذج بدقة أكبر.
أليس كذلك؟ لقد كان
هناك وقت لم نكن نعرف
فيه شيئاً عن الجراثيم
، لذا عندما كنت تتحدث
عن المرض، كنت تقول كل
أنواع الأشياء. أليس
كذلك؟ كنت تقول مثلاً
إنك بحاجة لاستنشاق
الهواء لهذا السبب، أو
أن روحاً ما تسيطر
عليك أو أياً كان، لكن
ليس" هناك كائن دقيق
جداً "، أليس كذلك؟ وهو
يتحرك هكذا، ويدخل إلى
خليتك ثم يفعل كذا
وكذا، وهذه هي مشكلتك.
حرفياً، المشكلة هي
هكذا، ولا يمكننا في
الغالب أن نكون بهذه
الدقة مع النماذج
اللغوية. لذا، نلجأ
إلى كل هذه الاستعارات
، وهذا لا يمكن أن يكون
الحالة النهائية،
أليس كذلك؟ لهذه
الأشياء. وآمل من خلال
دراستها، ألا نكتفي
بجعلها أكثر أماناً
فحسب، بل أن نفهم
التعريفات أيضاً.
الرياضيون في هذه
القاعة يعرفون أن
التعريف هو علامة نضج
المجال، أي أن يكون
لديك اسم للشيء الذي
تتحدث عنه. ولذا، آمل
في المستقبل القريب أن
نتوصل جميعاً، ممن
نعمل على هذه الأشياء،
إلى كلمات جديدة.
لوصفها بالطريقة
الصحيحة لفهم ما تفعله
. وهناك طريقة تبدو بها
النماذج وكأنها تنمو
أمام أعيننا. وربما
يمكننا معرفة أفضل
طريقة للحديث عنها.
وهذه هي النهاية.
شكراً جزيلاً لكم.
Ask follow-up questions or revisit key timestamps.
Loading summary...
Videos recently processed by our community