FRAMEWIREEnglishDiperbarui Sep 8Kabel langsung
0:00 / 0:00

Jadi saya mencoba menulis beberapa tes benchmark untuk model AI.

Garis dasar, garis emas, evaluasi penuh pada pengaturan multi-jalan. Tujuannya adalah untuk memecahkan Astra dan Fable dengan tingkat kelulusan 20-40%. Saya telah mengulangi dengan Astra dan Fable untuk benar-benar menulis evals saat saya mendesainnya - terus menerus rusak…

Mladen LotarSep 8
0:00 / 0:00

Kupikir aku akan membagikan proyek Astra akhir pekanku

Sebuah "harness novel grafis" untuk menjelajahi dunia dan cerita fiksi ilmiah. Tautan dalam balasan di bawah — balas dan saya akan DM Anda kata sandinya. Apa itu: Novel grafis generatif yang meluas saat Anda membacanya, maju atau mundur. Jika Anda menyorot a

Jeremy KirshbaumSep 81
0:00 / 0:00

Model sumber terbuka baru saja tertinggal 0,1 poin dari claude opus 5 dalam otomatisasi alur kerja

Nex-N2.5 Max mendapat skor 50,2 di AutomationBench v1.0.6. Opus 5 mendapat skor 50,3. Kesenjangan itu kecil. Modelnya tidak. Rangkaian produk ini dimulai dengan 35B Mini, berpindah ke 397B multimodal Pro, dan diakhiri dengan

AsteriSep 826
0:00 / 0:00

Ketika opus 5 memberi tahu saya bahwa kapasitor fluks termasuk dalam konfigurasi tailwind sebagai argumen opsional di dalam metode TNMNT.

Jefferson BonaparteSep 8