Model versi lama dengan parameter setengahnya, tapi performanya lebih tinggi jadi ekspektasinya sangat besar.
Llama Cloud API dan server yang bekerja keras untuk membuat token sehingga cepat.
Menggunakan mode chat sangat cepat.
Saya sudah mencoba menghubungkannya dengan OpenCLO dan Hermes open-source API.
Open-source dan API sudah sangat memuaskan. Cukup beri perintah saja.
Kecepatannya bagus dan hasilnya memuaskan,
Masalahnya ada di agent tool OpenCLO dan Hermes.
Biasanya saya berdialog dengan agent tool seperti ini untuk memberi perintah.
Tapi pikiran saya terlalu banyak, jadi saya mencoba mematikan proses berpikir tapi hasilnya tetap sama.
Mengurangi parameter dan meningkatkan performa sepertinya karena proses berpikir yang sangat intensif.
Jadi ketika diberi perintah, agent ini akan memikirkan banyak hal sehingga menjadi lambat. Hasilnya bagus tapi kadang sulit untuk memastikan apakah ia sedang bekerja atau berhenti.
Saya sudah menulis di agent.md dan memory.md untuk hanya menggunakan Hangul, Inggris, angka, dan karakter khusus. Tapi setelah diberi perintah sekali, ia akan menulis banyak kalimat dalam bahasa Inggris. Ketika saya meminta agar menjawab dalam bahasa Korea, ia beralasan bahwa pikirannya ikut tercantum dalam pesan.
Ini sepertinya masalah pada model itu sendiri.
Sekarang ada banyak model baru yang menarik seperti glm5.3-flash, qwen3.8-27b, dan qwen3.8-flash-next.