[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"site-settings":3,"workflow-automated-llm-testing-gpt4-judge-sheets-tracking-1825":7},["Reactive",4],{"analytics_enabled":5,"gtm_container_id":6},true,"GTM-WWB2TQFD",["Reactive",8],{"id":9,"slug":10,"title":11,"short_description":12,"category_key":13,"category_title":14,"workflow_type_key":15,"workflow_type_title":15,"workflow_type_icon":16,"price":17,"is_free":5,"cover_image":18,"description":19,"compatible_versions":18,"locked":5,"lock_reason":20,"purchased":21,"in_cart":21,"workflow_file":22},1410,"automated-llm-testing-gpt4-judge-sheets-tracking-1825","ارزیابی خودکار پاسخ‌های مدل‌های زبانی با داور GPT-4","موارد آزمون را از Google Sheets می‌خواند، پاسخ‌های مدل زبانی را با GPT-4.1 ارزیابی می‌کند و نتیجه و دلیل را در شیت ثبت می‌کند.","data-processing-workflows","تولید و پردازش داده","n8n","https:\u002F\u002Faidock.s3.ir-thr-at1.arvanstorage.ir\u002Fworkflow_types\u002Fimage.webp",0,"","🧪 این گردش‌کار، موارد آزمون را از Google Sheets دریافت می‌کند و پاسخ‌های مدل زبانی را از طریق یک وب‌هوک برای ارزیابی ارسال می‌کند.\n\n⚖️ مدل GPT-4.1 در OpenRouter هر پاسخ را فقط بر اساس پاسخ مرجع بررسی کرده و معیارهای **درستی factual، ارتباط و کامل‌بودن** را می‌سنجد. نتیجه به‌صورت ساختاریافته شامل `Pass` یا `Fail` و دلیل ارزیابی تولید می‌شود.\n\n📊 در پایان، داده‌های اصلی، پاسخ مدل، تصمیم داور و توضیحات آن در شیت نتایج ثبت یا به‌روزرسانی می‌شوند.","login",false,null]