FRAMEWIREEnglishDiperbarui Sep 6Kabel langsung
0:00 / 0:00

Mengerti — format benchmark yang sama, kali ini burger, dengan Grok (4.6) menggantikan Kimi di lineup.

Berikut postingannya: Perintah yang sama: "buat burger." Empat model AI. Salah satu dari mereka rupanya lupa seperti apa burgernya. ChatGPT (GPT-5.6 Sol) menggambar apa yang pada dasarnya a

MaciavellySep 6
0:00 / 0:00

Claude Opus 5 tergila-gila pada desain web.

Perintah ↓

Faisal AhmedSep 67
0:00 / 0:00

Claude Opus 5 sebesar 30,2% di ARC‑AGI‑3, rata-rata diukur oleh masyarakat awam sekitar 48%, dan GPT‑6 Astra langsung mencapai 99,9%.

Yang kami lewati kali ini bukan sekadar daftar peringkat, melainkan garis pemisah antara manusia dan kecerdasan mesin. Claude Fable 5.1 belum memiliki hasil verifikasi publik.

岩创AISep 6
0:00 / 0:00

GPT-6 Astra vs Claude Opus 5 semakin konyol

Astra : → 99,9% pada ARC-AGI-3 → 98% di FrontierMath Tingkat 4 → masukan $10 / keluaran $50 per 1 juta token Claude Opus 5 : → SOTA di Frontier-Bench → SOTA pada GDPval-AA → ~1,5x model terbaik berikutnya di AutomationBench pada saat yang sama

LummoxSep 621