Kimi K3, Gemini 3.7 Flash, GPT-5.6 Sol, dan Claude Opus 5 memiliki tema yang sama persis: ``Gambarlah herbivora yang terintegrasi dengan dadu.''
Kimi → Domba GPT-5.6 → Sapi Karya 5 → Sapi Gemini → Siput Untuk tujuan kreatif, penting juga untuk mempertimbangkan bagaimana memperluas instruksi yang ambigu.
Dari 30% menjadi 100% tanpa mengubah model
NVIDIA mengambil Claude Opus 5 dan tidak menyentuh satu peso pun Pada benchmark ARC-AGI-3, modelnya saja sudah sekitar 30%. Pada sistem NVIDIA, yang disebut AVO, model yang sama menyelesaikan semua 183 level dan mendapat skor 100/100 Dan dia melakukannya secara praktis
Nvidia menjalankan Claude Opus 5 di ARC-AGI-3.
Dengan sendirinya: 30% — hasil teratas dari setiap model yang diuji. Model yang sama + harness custom + agen supervisor = 100%. Harness adalah tuas sebenarnya. Databricks: harness yang salah dapat melipatgandakan biaya Anda. Berhenti mengejar model terbaru. Miliki milikmu…
Adegan benchmark baru: Saya memberikan satu perintah kepada Claude Code (Opus 5).
Buat ulang baku tembak lobi Matrix di Three.js dari repo kosong. Ini menghasilkan semua tekstur, SFX & musik itu sendiri (OpenAI, ElevenLabs, Suno) dan diverifikasi sendiri dengan tangkapan layar. Hasil: Demo 62 detik, tes 31/31, 1
Sudah sampai ujung arsip
Semua Claude Opus 5