ARTIKEL•BERITA 2+

Hy3 Model Underrated yang Biasa di Benchmark Tapi Luar Biasa di Kerja Nyata

24 Agustus 2026•
Image for Hy3 Model Underrated yang Biasa di Benchmark Tapi Luar Biasa di Kerja Nyata

Ada satu model yang sedang sangat diremehkan saat ini, yaitu Hunyuan Hy3 buatan Tencent. Kalau hanya melihat leaderboard, Hy3 sangat gampang diabaikan karena angkanya tidak menonjol dan sering kalah dari model sekelasnya. Namun begitu dipakai untuk pekerjaan harian terutama bug fixing dan refactoring, model ini terasa jauh lebih matang dan hati-hati dibanding sejumlah model yang di atas kertas jauh lebih capable.

Saya sendiri sempat mengabaikan Hy3 karena skor Intelligence Index yang berada di tengah dan hasil SWE-bench yang tidak memimpin. Baru setelah mencobanya langsung selama beberapa hari untuk refactor dan perbaikan bug di repository pribadi, saya menyadari bahwa angka di papan skor tidak sepenuhnya mencerminkan pengalaman pemakaian. Hy3 terasa dirancang untuk kerja jangka panjang, jarang membuat kecerobohan yang justru paling menguras waktu saat coding.

Angka Benchmark Hy3 Memang Tidak Menonjol

Versi resmi Hy3 yang dirilis Juli 2026 tidak menonjol jika hanya dilihat dari leaderboard populer. Pada Intelligence Index dari Artificial Analysis, Hy3 versi resmi mencatatkan skor 42, tertinggal dari GLM-5.2 yang mencapai 51 hingga 53, DeepSeek V4 Flash 0731 yang mencapai 50, serta Qwen3.8 27B yang mencapai 52. Pada benchmark kerja agentik dunia nyata seperti GDPval-AA, posisinya juga tidak di papan atas dan masih tertinggal dari model-model yang sama.

Di arena.ai (LMArena), Hy3 versi resmi mencatatkan skor 1457 di text leaderboard dan 1501 di coding leaderboard, naik dari 1412 pada versi preview. Angka ini menempatkannya di papan tengah atas di antara ratusan model, namun masih di bawah GLM-5.2 dan Qwen3.8 di arena yang sama. Gambaran serupa terlihat di sisi coding, di mana versi resmi Hy3 mencetak 78,0 di SWE-bench Verified dibanding GLM-5.2 84,2, serta 71,7 di Terminal-Bench 2.1 dibanding 81 dan 28,0 di DeepSWE dibanding 46,2. Data coding ini berasal dari laporan teknis Tencent dan konsisten dengan pengujian pihak ketiga.

Menurut saya, skor komposit Intelligence Index yang menggabungkan sembilan evaluasi memang cenderung menguntungkan model yang kuat di banyak domain sekaligus, sehingga posisi Hy3 di tengah tidak otomatis berarti buruk untuk pekerjaan coding sehari-hari. Saya pun awalnya menyimpulkan Hy3 kelas menengah hanya dari angka, sampai menyadari bahwa SWE-bench dan benchmark serupa hanya mengukur keberhasilan pada satu tugas terisolasi, bukan kenyamanan pemakaian berjam-jam. Kenaikan arena dari 1412 ke 1457 juga menurut saya lebih relevan daripada peringkatnya sendiri, karena menunjukkan perbaikan versi resmi yang terasa di penilaian manusia langsung.

Penilaian Tencent Soal Benchmark dan Hasil Evaluasi Nyata

Yang menarik, Tencent justru tidak mendorong narasi juara benchmark. Alih-alih memamerkan leaderboard, mereka merilis blind human study independen dengan 270 pakar yang menguji model pada 312 skenario kerja nyata. Evaluasi buta seperti ini menurut saya jauh lebih dekat dengan apa yang dirasakan pengguna di lapangan daripada skor otomatis yang sering dioptimalkan khusus.

Hasilnya, Hy3 versi resmi mendapat skor 2,67 dari skala 4 dan mengalahkan GLM-5.1 yang mendapat 2,51, dengan keunggulan paling jelas di frontend development, CI/CD, serta pekerjaan data dan storage. Area tersebut sangat membutuhkan kehati-hatian dan konsistensi, bukan sekadar kecerdasan mentah, dan di sinilah Hy3 terasa lebih dapat diandalkan karena jarang mengubah hal di luar instruksi.

Tencent juga membagikan angka internal versi resmi yang jarang dipublikasikan.

  • Tingkat halusinasi pada evaluasi internal tercatat 5,4% pada versi resmi.
  • Tingkat kesalahan commonsense tercatat 12,7% pada versi resmi.
  • Tingkat masalah pada percakapan multi-turn tercatat 7,9% pada versi resmi.

Angka-angka ini menurut saya jauh lebih penting daripada selisih beberapa poin di Intelligence Index. Halusinasi 5,4% berarti model jauh lebih jarang mengarang jawaban saat tidak yakin, dan masalah multi-turn yang rendah sangat terasa saat sesi agent berlangsung panjang tanpa kehilangan arah.

Prinsip post-training yang mereka tanamkan cukup sederhana, yaitu model diminta menjawab jika punya dasar yang jelas, mengakui jika tidak yakin, dan tidak mengarang jawaban. Prinsip ini menjelaskan kenapa Hy3 terasa lebih berhati-hati. Model seperti DeepSeek V4 memang lebih cepat dan efisien dalam pemanggilan tool, tetapi lebih rawan ceroboh saat menulis kode. Dari pengalaman saya membandingkan keduanya, DeepSeek sering menyelesaikan langkah lebih cepat namun sesekali melakukan perubahan yang tidak diminta, sementara Hy3 hampir tidak pernah melakukan kecerobohan serupa sehingga terasa lebih aman untuk pekerjaan sensitif.

Fokus Tencent bukan mengejar skor leaderboard, melainkan menstabilkan hal-hal yang paling terasa sehari-hari seperti kestabilan pemanggilan tool, format output yang konsisten, dan pemulihan yang baik saat terjadi error di tengah proses agentic. Hal-hal kecil seperti ini tidak pernah muncul di SWE-bench, tetapi sangat menentukan apakah sesi kerja berjam-jam tetap nyaman atau justru melelahkan.

Konsistensi Lintas Alat Coding

Satu detail teknis yang relevan dengan pemakaian harian adalah variasi akurasi Hy3 yang tetap di bawah 4% pada SWE-bench Verified ketika dijalankan melalui scaffolding agent berbeda seperti CodeBuddy, Cline, dan Kilo Code. Artinya, model dirancang untuk tetap stabil apa pun alat yang membungkusnya dan tidak hanya dioptimalkan untuk satu environment tertentu. Hal ini konsisten dengan pengalaman pengguna di Kilo Code maupun opencode di mana performa tidak mendadak turun saat berpindah alat.

Secara pribadi, saya sangat menghargai stabilitas ini. Pada Hy3, variasi di bawah 4% benar-benar terasa dan perilakunya tetap dapat diprediksi tanpa harus menyesuaikan gaya instruksi secara drastis setiap ganti alat.

Hy3 juga dilengkapi mode reasoning effort yang bisa diatur sesuai kebutuhan.

  • Mode default adalah mode cepat tanpa reasoning panjang untuk tugas standar.
  • Mode low dan high bisa diaktifkan khusus untuk tugas berat seperti refactor yang rumit.

Fitur ini menurut saya sangat membantu efisiensi. Untuk perbaikan kecil, mode default sudah lebih dari cukup dan jauh lebih hemat token serta waktu, sementara untuk refactor lintas banyak file, mode high memberikan kedalaman analisis yang benar-benar dibutuhkan tanpa harus selalu membayar overhead yang sama.

Bagi saya, kombinasi stabilitas lintas alat dan kontrol reasoning effort inilah yang membuat Hy3 terasa dirancang untuk penggunaan nyata, bukan untuk demonstrasi benchmark.

Alasan Utama Hy3 Sangat Underrated

Secara benchmark coding murni seperti SWE-bench, Terminal-Bench, dan DeepSWE, Hy3 versi resmi memang belum menjadi juara dan masih di bawah GLM-5.2. Namun di situlah letak keunikannya dan alasan utama kenapa reputasinya belum mencerminkan kualitas sebenarnya.

Sebagian besar orang menilai model coding hanya dari leaderboard, padahal leaderboard seperti SWE-bench hanya mengukur keberhasilan pada satu tugas terisolasi, bukan kenyamanan pemakaian berjam-jam. Menurut saya, kebiasaan inilah yang membuat Hy3 terlihat diremehkan, karena banyak pengguna melihat 78,0 vs 84,2 dan langsung menganggapnya kalah telak tanpa mempertimbangkan keandalan saat dipakai seharian.

Ada satu asumsi yang menurut saya cukup masuk akal. Mungkin saja Hy3 memang adalah model yang genuine dan tidak melakukan benchmaxxing sama sekali, sehingga skor benchmarknya lebih rendah dibanding model yang dioptimalkan khusus untuk leaderboard. Jika benar, maka angka yang terlihat biasa justru menjadi bukti bahwa Tencent lebih memilih mengoptimalkan pengalaman nyata, dan ini menjelaskan kenapa performa di dunia nyata terasa jauh lebih baik daripada angka benchmark.

Pada dimensi pemakaian nyata inilah Hy3 versi resmi diam-diam sangat unggul.

  • Tingkat halusinasi tercatat 5,4% pada evaluasi internal versi resmi.
  • Tingkat masalah pada percakapan panjang tercatat 7,9% pada versi resmi.
  • Konsistensi lintas alat coding dijaga ketat dengan variasi di bawah 4% pada CodeBuddy, Cline, dan Kilo Code.

Semua poin di atas tidak muncul di angka SWE-bench, padahal sangat menentukan apakah pengguna bisa memercayai hasil kerja model saat refactor skala besar atau bug fixing yang berisiko merusak kode lain. Saya sendiri merasakannya saat refactor puluhan file, di mana halusinasi rendah berarti model tidak mengarang API yang tidak ada dan konsistensi lintas alat membuat saya tetap produktif tanpa khawatir performa anjlok karena ganti scaffolding.

Selain itu, Hy3 bersifat open weight dengan lisensi Apache 2.0 dan hanya mengaktifkan 21 miliar dari total 295 miliar parameter. Saat ini Hy3 juga masih bisa dicoba gratis di Kilo Code dan opencode. Dengan parameter aktif yang jauh lebih kecil, Hy3 jauh lebih hemat sumber daya dibanding model dengan parameter aktif dua kali lipat, namun tetap dapat diandalkan, sehingga hambatan untuk mencoba menjadi sangat rendah.

Kombinasi akses gratis, hemat sumber daya, dan lebih dapat dipercaya inilah yang membuat status underrated Hy3 terasa tidak adil. Jika tujuanmu mengejar skor tertinggi di papan peringkat, Hy3 mungkin bukan pilihan pertama. Namun jika tujuanmu menyelesaikan pekerjaan nyata dengan lebih tenang, hemat, dan minim kecerobohan, Hy3 versi resmi menurut saya adalah salah satu yang paling layak dipertimbangkan saat ini.