smevals: मॉडल, प्रॉम्प्ट और हार्नेस के मूल्यांकन के लिए नया टूल
OpenAI
Anthropic
साइमन विलिसन ने smevals प्रस्तुत किया है - यह एक नया फ्रेमवर्क है जो विभिन्न मॉडल कॉन्फ़िगरेशन के लिए छोटे मूल्यांकन सेट (evals) चलाने और परिणामों का आकलन करने के लिए है। टूल में चलाने, मूल्यांकन करने और परिणामों को विज़ुअलाइज़ करने के कमांड शामिल हैं, साथ ही स्टैटिक HTML रिपोर्ट जनरेशन का समर्थन भी करता है।
साइमन विलिसन ने जेसी विंसेंट की प्रयुक्त एआई प्रयोगशाला प्राइम रेडिएंट के साथ मिलकर smevals विकसित किया है — यह एक नया उपकरण है जो विभिन्न मॉडल कॉन्फ़िगरेशन के लिए छोटे मूल्यांकन परीक्षण (evals) चलाने और परिणामों का आकलन करने हेतु है। यह उपकरण उपयोगकर्ताओं को YAML फ़ाइलों वाले निर्देशिकाओं के रूप में eval-सेट बनाने, उन्हें gpt-5.5 और claude-opus-4.6 जैसे मॉडलों पर चलाने, और फिर निर्धारित जाँचों के माध्यम से परिणामों का मूल्यांकन करने की सुविधा देता है। परिणामों के विश्लेषण हेतु एक स्थानीय वेब सर्वर और स्थैतिक HTML रिपोर्ट निर्माण कमांड प्रदान किया गया है। विलिसन ने बताया कि यह उनके eval दृष्टिकोण का तीसरा संस्करण है, और वे भविष्य में इस उपकरण का विस्तार करने की योजना बना रहे हैं।
स्रोत: Simon Willison —
मूल
