ARTIKEL•BERITA 2+

Tencent Rilis Hy4 Preview, Lompatan Besar dari Hunyuan untuk Kelas Model Produktivitas

28 Agustus 2026•
Image for Tencent Rilis Hy4 Preview, Lompatan Besar dari Hunyuan untuk Kelas Model Produktivitas

Pada 28 Agustus 2026 Tencent Hunyuan resmi merilis dan meng-open-source-kan generasi terbaru model bahasa besarnya, Hy4 preview. Penerus Hy3 ini datang dengan lompatan yang cukup signifikan dari sisi ukuran, panjang konteks, dan performa di berbagai tugas produktivitas dunia nyata, mulai dari coding, kerja kantoran, sampai riset ilmiah.

Rilis ini juga menegaskan pola iterasi Hunyuan yang sangat agresif sejak pembangunan ulang infrastruktur pada Februari 2026. Lewat pendekatan preview-first lalu versi resmi, Tencent sengaja merilis lebih awal untuk menyerap umpan balik dunia nyata. Berdasarkan pengumuman resmi Tencent pada 28 Agustus dan repositori GitHub Tencent-Hunyuan/Hy4-preview, iterasi cepat ini yang membuat Hy3 matang secara signifikan, dan Hy4 preview disebut sebagai lompatan generasi terbesar yang pernah tercatat dalam pengukuran internal Hunyuan.

Spesifikasi Utama

Hy4 preview dibangun dengan arsitektur Mixture-of-Experts (MoE) berskala besar:

  • Total 770 miliar parameter dengan 49 miliar parameter aktif per token
  • Konteks mendukung lebih dari 1 juta token
  • 78 layer backbone, layer pertama berupa dense FFN standar dan 77 layer sisanya MoE dengan 256 routed expert dan 1 shared expert per layer serta top-8 expert aktif per token
  • 1 layer native MTP (Multi-Token Prediction) dengan 10 miliar parameter total dan 0,7 miliar aktif untuk mempercepat speculative decoding
  • Mekanisme Gated DeepSeek Sparse Attention (Gated DSA) dengan IndexCache plus identity Hyper-Connections (iHC) pada jalur residual
  • Hidden size 6144, 64 attention heads, vocab 120832, dan dirilis di bawah lisensi Apache License 2.0

Dibandingkan Hy3 yang hanya 295 miliar parameter total dan 21 miliar aktif, Hy4 preview lebih dari dua kali lipat lebih besar, dengan parameter aktif yang juga berlipat ganda dan konteks yang naik dari 256K menjadi 1M. Ini bukan pembesaran asal tambah. Kombinasi Gated DSA dan iHC menunjukkan Tencent cukup serius memikirkan efisiensi arsitektur, bukan sekadar menumpuk parameter demi angka besar di atas kertas. Di Hugging Face dan ModelScope, bobot tersedia dalam varian penuh dan varian FP8 yang lebih ringan untuk beban multi-GPU.

Fokus pada Produktivitas Dunia Nyata

Tencent memposisikan Hy4 preview sebagai model yang dirancang khusus untuk skenario produktivitas, yaitu rekayasa perangkat lunak, analitik kantoran, pengembangan game, dan riset ilmiah. Model ini dikembangkan lewat kolaborasi dengan tim ahli internal Tencent di berbagai domain seperti software engineering, gaming, finance, dan security, serta ko-desain mendalam dengan produk seperti CodeBuddy dan WorkBuddy.

Dalam evaluasi blind internal yang melibatkan 163 pakar dan 203 tugas rekayasa perangkat lunak di lingkungan WorkBuddy, Hy4 preview meraih skor rata-rata 2,99 dari 4,00, sedikit lebih unggul dibanding GLM 5.3 pada 2,92 dan Kimi K3 pada 2,94. Selisihnya tipis, jadi mungkin lebih tepat dibaca sebagai setara ketimbang unggul telak. Rinciannya juga mengungkap nuansa penting, yaitu:

  • Lawan GLM 5.3, Hy4 menang 46,8 persen, seri 12,8 persen, dan kalah 40,4 persen
  • Lawan Kimi K3, Hy4 menang 51,2 persen, seri 7,9 persen, dan kalah 40,9 persen

Beberapa kemampuan yang ditonjolkan antara lain sebagai berikut.

Software Engineering

Pemahaman, perencanaan, debugging, dan validasi yang lebih kuat untuk tugas pengembangan berkonteks panjang, termasuk membangun proyek frontend kompleks dari nol dengan selera visual yang lebih baik.

Game Development

Menghasilkan prototipe yang bisa dimainkan dari satu prompt hingga demo lengkap di Unity dan terus disempurnakan lewat interaksi multi-turn.

Office dan Analitik

Menangani audit finansial kompleks dengan menyaring dan menganalisis banyak dokumen sekaligus, lalu mengubah konteks berantakan menjadi dokumen, spreadsheet, dan presentasi yang rapi.

Riset Ilmiah

Mempercepat simulasi dinamika molekuler dan mulai membangun loop perbaikan diri secara rekursif, termasuk riset AI, fisika materi terkondensasi, dan matematika murni.

Yang menarik, Tencent secara terbuka mengakui bahwa ini masih versi awal (preview) dengan sejumlah kekurangan yang diketahui, yaitu kecenderungan menghabiskan waktu lebih lama dari perlu saat bernalar pada tugas kompleks, serta kecenderungan over-verify terhadap hasil kerjanya sendiri. Keterbukaan tersebut memberi nilai plus dari sisi kejujuran, meski di saat yang sama juga menjadi sinyal bahwa model belum benar-benar siap untuk beban kerja produksi yang kritikal.

Kesan Personal Setelah Mencoba Langsung

Pengujian Hy4 preview berlangsung selama beberapa hari lewat API Tencent Cloud TokenHub dan OpenRouter dengan model ID tencent/hy4-preview, termasuk mencoba versi gratis di WorkBuddy dan CodeBuddy yang berdasarkan pengumuman resmi dibuka gratis selama dua minggu sejak peluncuran, sementara akses gratis Hy3 diperpanjang sampai 30 September. Dari sisi akses, migrasi dari Hy3 berjalan lancar, karena parameter yang disarankan tetap temperature=0.9 dan top_p=1.0, dengan mode penalaran default high untuk tugas berat. Untuk jawaban langsung tanpa penalaran panjang, penambahan chat_template_kwargs dengan reasoning_effort bernilai no_think sudah memadai.

Untuk kerja coding harian, kesan awal saya pribadi menempatkan Hy4 sebagai model yang jauh lebih hati-hati dibanding Hy3. Saat permintaan refactor lintas belasan file di repositori pribadi saya diajukan, Hy4 tidak langsung melompat ke patch, melainkan menyusun rencana, memeriksa dependensi, lalu mengeksekusi dan menjalankan verifikasi. Hasil frontend yang dibangun dari nol juga tampak lebih teratur, terutama dalam hal konsistensi spasi dan interaksi, yang memang menjadi salah satu aspek yang ditekankan Tencent.

Dari sisi skala, perbedaan 770 miliar dibanding 295 miliar pada Hy3 terlihat langsung dalam penggunaan menurut saya pribadi. Kapasitas pada tugas berlapis meningkat, namun biaya turut naik. Tarif API Hy4 berada di atas Hy3, dan kebutuhan multi-GPU untuk self-hosting bahkan pada varian FP8 tetap memerlukan investasi besar. Meski secara umum masih terjangkau, menurut saya pribadi kenaikan harga dari Hy3 ke Hy4 cukup terasa, karena biaya inferensi per juta token memang lebih tinggi untuk model yang jauh lebih besar ini. Keseimbangan antara tenaga tambahan dan biaya menjadi pertimbangan utama ketika memilih antara Hy3 untuk kerja cepat yang hemat dan Hy4 untuk eksplorasi mendalam.

Pada tugas kantor yang melibatkan banyak dokumen, Hy4 unggul dalam merangkum konteks yang berantakan. Pengujian saya dengan kumpulan laporan keuangan dan catatan rapat dalam format campuran menunjukkan kemampuan menarik angka kunci, menyusun tabel ringkas, serta menulis ulang menjadi draf presentasi tanpa kehilangan konteks antar berkas. Namun di sinilah konteks 1 juta token perlu dipakai dengan bijak. Konteks besar bukan jaminan ingatan yang sempurna. Hasil cenderung lebih stabil ketika dokumen utama disiapkan terlebih dulu ketimbang memasukkan semuanya sekaligus secara mentah.

Pola over-verify yang diakui Tencent juga teramati selama pengujian saya. Pada tugas kompleks, Hy4 kadang menghabiskan langkah ekstra untuk memeriksa ulang hasil yang sebenarnya sudah benar, sehingga latensi dan konsumsi token naik. Solusi praktis yang terbukti membantu adalah mendefinisikan acceptance test yang jelas di prompt dan memberi instruksi kapan harus berhenti. Untuk perbaikan kecil, mode tanpa penalaran jauh lebih hemat dan sudah memadai. Untuk refactor berat, mode high baru benar-benar perlu.

Dibanding pengalaman langsung saya dengan Hy3 yang underrated namun sangat hati-hati di perbaikan bug, Hy4 terlihat sebagai kelanjutan yang lebih ambisius. Hy3 memberikan keandalan karena jarang mengarang, Hy4 menambah kapasitas dorongan yang lebih jauh pada tugas agenik panjang. Apabila Hy3 sesuai untuk kerja harian yang membutuhkan kehati-hatian, Hy4 lebih sesuai ketika tugas menuntut eksplorasi berlapis, pencarian kesalahan yang panjang, dan iterasi multi-turn, dengan catatan biaya dan waktu penalaran dikelola dengan cermat.

Hasil Benchmark

Hy4 preview diuji di berbagai kategori dan dibandingkan dengan model kelas atas lain seperti DeepSeek V4 Pro 0813, Qwen 3.8 Max, GLM 5.3, Kimi K3, GPT 5.6 Sol, dan Claude Opus 5. Berikut sorotan dari kategori Agentic Coding, di mana kenaikannya paling terasa:

BenchmarkHy3Hy4 preview
SWE-bench Multilingual75.882.9
SWE-bench Pro57.965.7
DeepSWE28.064.3
Terminal-Bench 2.170.885.4
CyberGym51.878.4
ProgramBench3.017.5
Harbor-Index15.639.6

Pada Terminal-Bench 2.1, skor 85.4 milik Hy4 preview bahkan melampaui beberapa pengukuran DeepSeek V4 Pro 0813 pada 87.9 dan 80.3* dan berada dekat dengan model top-tier lain. Lompatan paling dramatis ada di DeepSWE yang naik dari 28.0 pada Hy3 menjadi 64.3, lebih dari dua kali lipat hanya dalam satu generasi. ProgramBench yang naik dari 3.0 menjadi 17.5 juga menunjukkan perbaikan lebih dari lima kali lipat.

Di kategori lain seperti Agentic Search, Working Agent, STEM Agent, dan Reasoning, Hy4 preview juga menunjukkan peningkatan yang cukup konsisten dibanding Hy3:

  • WideSearch naik dari 81.9 menjadi 83.9
  • OneMillionBench with tools naik dari 51.5 menjadi 65.4
  • Toolathlon Verified naik hingga 74.1 dan melampaui Qwen 3.8 Max serta GPT 5.6 Sol
  • APEX Agents pass at 1 naik menjadi 37.1 dan hampir menyamai Kimi K3 pada 37.2
  • MathArena Apex 2025 naik dari 38.7 menjadi 74.2, hampir dua kali lipat
  • GPQA Diamond naik dari 90.9 menjadi 92.3
  • SUPERChem naik dari 52.6 menjadi 66.4

Berdasarkan laporan yang dirangkum dari blog resmi Hunyuan dan liputan finansial per 28 Agustus, Hy4 preview tidak pernah menjadi yang terendah di satu pun dari 12 benchmark tersebut, sementara total dan parameter aktifnya jauh lebih kecil dari beberapa kompetitor di tier pertama. Hal tersebut penting karena menunjukkan efisiensi, bukan sekadar skala.

Secara umum, Hy4 preview berhasil menutup jarak dengan model kelas atas seperti GPT 5.6 Sol dan Claude Opus 5 di banyak benchmark, meski di sejumlah metrik masih tertinggal. Perlu dicatat, sebagian besar angka pembanding di tabel ditandai bintang (*), artinya hasil tersebut merupakan pengujian internal Tencent sendiri terhadap model kompetitor, bukan angka resmi yang dipublikasikan masing-masing vendor. Hasil tersebut tidak otomatis invalid, tapi ada baiknya menunggu hasil evaluasi independen sebelum klaim seperti melampaui DeepSeek V4 Pro dianggap final.

Harga dan Ketersediaan

Dari sisi harga, Hy4 preview terbilang cukup terjangkau:

  • USD 0,834 per juta token input atau sekitar Rp 15.800 per juta token
  • USD 2,501 per juta token output atau sekitar Rp 47.400 per juta token
  • USD 0,042 per juta token untuk cache hit atau sekitar Rp 790 per juta token

Angka tersebut jauh di bawah model closed-source kelas atas seperti GPT 5.6 Sol atau Claude Opus 5, dan sejalan dengan pola umum model asal Tiongkok seperti DeepSeek, Qwen, GLM, dan Kimi yang cenderung bersaing lewat efisiensi biaya. Bagi developer dengan biaya inferensi yang sensitif terhadap skala, hal tersebut kemungkinan jadi salah satu daya tarik utama, bukan cuma soal skor benchmark.

Model ini sudah bisa dicoba lewat produk Tencent seperti WorkBuddy dan CodeBuddy versi domestik dan internasional, Yuanbao, dan ima, serta diakses lewat API melalui Tencent Cloud TokenHub dan OpenRouter. Bobot model juga tersedia terbuka di Hugging Face, ModelScope, GitCode, dan CNB, dengan panduan deployment resmi untuk vLLM dan SGLang yang mengekspos API kompatibel OpenAI.

Khusus untuk self-hosting, Tencent menyediakan image siap pakai vllm/vllm-openai:hy4-preview dan lmsysorg/sglang:hy4-preview dengan dukungan speculative decoding lewat MTP. Namun perlu diingat, backbone 770 miliar parameter tetap membutuhkan kapasitas multi-GPU yang besar bahkan pada presisi FP8. Jadi untuk kebanyakan tim, memulai dari API hosted lebih masuk akal ketimbang langsung self-host.

Penutup

Hy4 preview membawa lompatan nyata dari Hy3, dengan 770 miliar parameter, konteks 1 juta token, dan gaya kerja yang lebih hati-hati pada tugas panjang. Menurut saya pribadi, model ini paling meyakinkan saat dipakai untuk eksplorasi berlapis dan perbaikan kode kompleks, sementara Hy3 tetap menjadi opsi hemat untuk kerja harian. Meski harga per token naik, nilainya masih terjangkau bagi tim yang membutuhkan kapasitas lebih besar.