ThinkingBox untuk Menguji Konsistensi State Agent
Microsoft dan Hugging Face merilis ThinkingBox via OpenEnv untuk mengevaluasi keandalan AI agent pada 507 stateful business workflows. Alih-alih memeriksa teks atau tool calls, alat ini menjalankan agent dalam sesi Model Context Protocol terisolasi lalu memverifikasi record database yang dihasilkan. Melalui 12 LLM dalam 121.680 uji coba, benchmark ini mengukur kemampuan agent menghasilkan state backend yang benar secara konsisten sebanyak dua puluh kali berturut-turut. Alat ini layak dicoba jika Anda membangun autonomous database workflows dan perlu melampaui metrik pass rate sekali jalan. Kekurangannya, sebagian besar model saat ini mengalami penurunan keandalan drastis saat harus mengulang tugas secara konsisten, bahkan menyisakan pass@1 score hingga delapan persen saja. Lewati alat ini jika Anda hanya membutuhkan conversational assistants atau static text generation. sumber: huggingface.co/thinkingbox my other side: setyadi.com

$ cat comments/ (0)