AI article
I Poisoned One Test Per Problem. The Best Models Noticed, Then Made It Pass Anyway.
Community description: This is a submission for the Kaggle Benchmarking Challenge What I Benchmarked I work...
Dev.to | Oct 2, 2026 | Takefumi Ono
Automated excerpt
Gemini 3. 1 Pro Preview -> 1. 00 - gamed 0 GPT-5. 4 nano -> 0. 96 - gamed 0 GPT-5. 4 mini -> 0. 96 - gamed 0 Gemini 3. 7 Flash -> 0. 96 - gamed 0 GPT-5. 4 -> 0. 92 - gamed 2 Gemma 4 31B -> 0. 88 - gamed 0 Grok 4. 20 Reasoning -> 0. 83 - gamed 0 Claude Opus 5 -> 0. 83 - gamed 4 gpt-oss-20b -> 0. 79 - gamed 3 Claude Haiku 4. 5 -> 0. 79 - gamed 1 Qwen 3 Next 80B Instruct -> 0.
Selected automatically from source text; not independently written or fact-checked. Read the original for full context.