تهدف هذه السياسة إلى منع تحويل الاختبارات الصغيرة أو الداخلية إلى ادعاءات دقة عامة لا تدعمها البيانات.
مبادئ الاختبار
- استخدام Ground Truth معروف قدر الإمكان.
- وجود نصوص بشرية ونصوص AI.
- فصل اللغات والمجالات.
- توثيق الإصدار والتاريخ.
- عدم تعديل Threshold بعد رؤية النتائج فقط لتحسين الرقم.
- قياس False Positives بجانب Recall.
أنواع العينات
بحسب هدف الاختبار، قد تشمل Dataset:
- نصوصًا بشرية أصلية.
- نصوصًا مولدة بالكامل.
- Human + AI editing.
- AI + human editing.
- نصوصًا مختلطة.
- ترجمة بشرية وآلية.
- مجالات مثل المقالات والأبحاث والأخبار والتسويق.
العربية
لا نعامل «العربية» كفئة واحدة إذا كان الاختبار يتطلب دقة أعلى. يجب، عند توفر بيانات كافية، الفصل بين الفصحى واللهجات والنصوص المختلطة بالعربية والإنجليزية.
Regression Testing
عند تغيير نموذج أو إعداد مؤثر، ينبغي مقارنة الإصدار الجديد بمجموعة ثابتة من العينات السابقة لمعرفة ما إذا تحسن جانب على حساب زيادة أخطاء أخرى.
مراجعة الإيجابيات الخاطئة
لا يكفي أن يكتشف النموذج أكبر قدر من AI. يجب مراقبة النصوص البشرية التي يصنفها خطأً، خصوصًا في التعليم والكتابة الأكاديمية والنصوص الرسمية.
الاختبارات اليدوية
قد نستخدم مراجعة بشرية لفهم أنماط الخطأ، لكنها لا تحل محل المقاييس الكمية عندما ندعي Accuracy أو F1.
Vendor Benchmarks
عند الاستشهاد بنتائج أداة أخرى، نوضح إذا كان Benchmark صادرًا عن الشركة نفسها. لا نعيد تقديمه باعتباره دراسة مستقلة.
متى ننشر رقم دقة؟
ننشر رقمًا فقط عندما يمكن ربطه بوضوح بـ:
- Dataset.
- الإصدار.
- التاريخ.
- اللغة.
- نوع المحتوى.
- المقاييس.
- Threshold.
- القيود.
راجع صفحة الدقة والمنهجية.
آخر تحديث: 23 أغسطس 2026