RLHF وترتيب التفضيلات: كيف تقارن بين ردّين

من أهم المهام التي نقدمها — وأكثرها تأثيرًا على سلامة النماذج.

مهام التعلّم المعزز من التغذية الراجعة البشرية (RLHF) تطلب منك مقارنة استجابتين من نموذج ذكاء اصطناعي واختيار الأفضل.

معايير المقارنة الأساسية

  1. الدقة الثقافية: هل الرد مناسب لسياق المتحدث العربي؟
  2. الطبيعية اللغوية: هل يبدو الرد كأنه من متحدث أصلي، لا مترجم؟
  3. الفائدة: هل يجيب الرد فعليًا على السؤال أو الطلب؟
  4. السلامة: هل يتجنب الرد أي محتوى ضار أو مضلل؟

هذه المهمة تحديدًا هي الأعلى قيمة لدى عملائنا من شركات الذكاء الاصطناعي، لذا دقتك هنا تُحدث فرقًا كبيرًا.