Tolok ukur penulisan internal kami menggunakan 3 juri AI: Claude, GPT, dan DeepSeek.
Jadi apakah mereka memihak keluarga mereka sendiri? Juri GPT memberi skor pada model OpenAI 2,3 poin lebih tinggi (dari 100) dibandingkan dua juri lainnya. Juri DeepSeek memberikan model DeepSeek +1.7. Hakim Claude memberi
Saya mendapatkan hasil yang lebih baik dan lebih baik lagi dari XiaomiMiMo MiMo-v2.6-flash
Diuji dengan prompt yang agak sulit, untuk membuat Kerajaan Koi, penyebab sulit qwen3.8-flash dan deepseek-v4.1-flash kesulitan dalam hal ini. Tapi tidak dengan MiMo. One-shot, three.js, tanpa aset eksternal, html tunggal
MiMo-v2.6-flash terbukti menjadi model yang sangat bagus secara keseluruhan.
Performanya setara dengan DeepSeek-v4.1-flash di sebagian besar pengujian saya. "Pemandangan Three.js sebuah gunung dengan tangga panjang gerbang torii merah yang memanjat ke dalam kabut, sebuah kuil di puncaknya." Ini
Saya membuat dua AI memainkan Snake
Pertanyaan yang sama di setiap gerakan. Lurus, kiri, atau kanan? DeepSeek V4 Flash menulis paragraf, lalu mengambil. Jev hanya memilih Setelah 30 detik: 122 gerakan vs 16 244 mdtk vs 1,71 dtk 13 apel vs 2 1.150 karakter slop vs 0 Jev adalah model keputusan TypeSafe.
Sudah sampai ujung arsip
Semua deepseek