← Benchmarks
SimpleQA: 4,326 short, fact-seeking questions from OpenAI for evaluating language model factuality. Uses LLM-as-a-judge grading.
Open benchmark problems affecting this task set.
Problems with a fix underway upstream.
Problems fixed upstream and recorded here.
Health numbers count affected task rows; benchmark-wide problems count once.