AI और ML · 16 सित॰
K-Bench 125 कॉन्फ़िगरेशन, 33 बेस मॉडल, 14 प्रदाताओं और 94.2% चिकित्सक सहमति वाले स्थिर GPT-4o निर्णायक के साथ arXiv पर पहुँचा
एक नया चिकित्सक-कैलिब्रेटेड बेंचमार्क LLM सुरक्षा मूल्यांकन को प्रॉम्प्ट-कार्ड दिखावे के बजाय बहु-चरणीय, उच्च-जोखिम वाली बातचीतों की ओर ले जाता है।
- संवेदनशील AI वर्कफ़्लो का मूल्यांकन एकल प्रॉम्प्ट डेमो से नहीं, बल्कि मल्टी-टर्न परिदृश्यों से करें।
- स्वचालित सुरक्षा स्कोर पर भरोसा करने से पहले LLM जजों को विशेषज्ञ सहमति के विरुद्ध सत्यापित करें।
- सुरक्षा-महत्वपूर्ण आयामों को अलग-अलग ट्रैक करें क्योंकि समग्र रूप से मजबूत मॉडल व्यवहार जोखिम-विशिष्ट कमजोरियों को छिपा सकता है।