3 repos
HeegyuKim/FLEX
FLEX: Expert-level False-Less EXecution Metric for Reliable Text-to-SQL Benchmark (NAACL 2025 Oral)
12
7 commits
GoogleCloudPlatform/evalbench
EvalBench is a flexible framework designed to measure the quality of generative AI (GenAI)…
56
1,225 commits
t3rmin4t0r/critique-evals
No description
0
19 commits