Gemini 3.7 Kilat
Instruksi pengkodean untuk simulasi fisik tetesan air yang jatuh di permukaan air dengan Python dan HTML5, satu permintaan koreksi (pemasangan bilah perubahan kuantitatif) Berpikir kurang dari beberapa detik, mengeluarkan kode sekitar 1 detik Menjalankan video di Google Colab Ketika saya mencoba prompt yang sama dengan Qwen 3.8 27B Q8_0, itu menghabiskan banyak token dan berhenti di tengah jalan.
Qwen 3.8-27B (Pantai Emas) vs Opus 4.6 (Dunia Pesisir)
Perintah yang sama persis, keduanya hanya diberi satu kesempatan untuk melihat apa yang akan mereka hasilkan.
Pembaruan pada titik akhir komunitas gratis Qwen 3.8-27B (menjadi agak terlalu lambat)
2x replika H200 (+1 replika) sekarang gunakan decoding spekulatif (70 → 126 tok/s, diukur) pemikiran default sekarang menjadi sedang jika tidak disetel (xhigh membakar token dalam jumlah besar)
Telah menggunakan Qwen 3.8 27B (Q4) secara lokal pada VRAM 64GB.
Inilah putusannya: LAMBAT 18 tps dengan prompt sistem NOL untuk diproses dan itu menurun secara signifikan dengan prompt sistem harness dan seiring dengan bertambahnya jendela konteks. RIP kalau harus kompak. Saya telah menerapkan PRD ini
Sudah sampai ujung arsip
Semua qwen38