Model anonim membakar 26 triliun token dalam empat hari. Daftar harganya baru datang kemudian: 24 sen.
Pada 20 Agustus 2026, sebuah model tanpa laboratorium, tanpa kartu model, dan tanpa harga muncul di OpenRouter dengan nama stealth/ox-alpha. Empat hari kemudian pengguna OpenCode sudah mengalirkan 26 triliun token melewatinya. Enam hari kemudian Z.AI mengakuinya: GLM-5.3-Flash, 320 miliar parameter, lisensi MIT, 0,15 dolar per juta token masukan. Mengapa laboratorium kini merilis model tanpa mencantumkan namanya sendiri, apa yang sebenarnya diukur angka-angka trafik itu, dan apa arti harga campuran 24 sen bagi ekonomi pipeline suara.
Pada 20 Agustus 2026, sebuah model muncul di OpenRouter dengan slug stealth/ox-alpha. Tidak ada laboratorium yang tercantum. Tidak ada kartu model, tidak ada tabel tolok ukur, tidak ada utas pengumuman. Kolom harga menunjukkan 0 dolar untuk masukan, 0 dolar untuk keluaran. Yang dimilikinya adalah jendela konteks 1.048.576 token, masukan teks, gambar, dan video, serta satu baris deskripsi tentang rekayasa perangkat lunak jangka panjang.
Empat hari kemudian, OpenCode mengumumkan bahwa penggunanya telah mengalirkan 26 triliun token melewatinya.
Enam hari kemudian, Z.AI mengonfirmasi kepada Bloomberg bahwa model itu miliknya, merilis bobotnya di bawah lisensi MIT, dan melampirkan daftar harga: lima belas sen per juta token masukan, lima puluh sen per juta token keluaran. Namanya GLM-5.3-Flash. Kata "Flash" dalam kalimat itu memikul beban yang luar biasa besar, dan itulah alasan kami menulis artikel ini.
Ini adalah tulisan komentar, bukan liputan rilis. Yang menyusul adalah linimasa enam hari lengkap dengan angka trafik beserta catatan pentingnya, argumen tentang mengapa laboratorium semakin sering merilis model tanpa nama siapa pun, spesifikasi dan skor independen setelah identitasnya terungkap, daftar tegas klaim yang tidak dapat kami verifikasi, dan perhitungan rinci tentang apa yang dilakukan harga campuran 24 sen terhadap biaya memproses ucapan. Ini kelanjutan langsung dari perbandingan sebelum dan sesudah kami tentang kebangkitan model lokal, dan arahnya sama: harga kecerdasan mesin yang cakap masih terus turun, lebih cepat daripada asumsi sebagian besar peta jalan produk.
Ringkasnya:
- Trafiknya nyata dan memecahkan rekor. 26 triliun token di OpenCode dalam empat hari dari 327.000 pengguna unik, dan 11,6 triliun di OpenRouter dalam tiga hari — peluncuran model terbesar dalam sejarah OpenRouter, dibandingkan rekor sebelumnya 4,4 triliun.
- Identitasnya terkonfirmasi dari sumber utama. Z.AI menyampaikan kepada Bloomberg pada 26 Agustus 2026 bahwa Ox Alpha adalah model seri GLM; halaman OpenRouter sendiri kini menyatakan model siluman itu "dikembangkan dan dioperasikan oleh ZAI, terungkap sebagai ZAI GLM-5.3-Flash".
- Harganya adalah inti beritanya. 320 miliar parameter total dengan 18 miliar aktif, lisensi MIT, 0,15 dolar masukan dan 0,50 dolar keluaran per juta token — campurannya 0,24 dolar, melawan 10,00 dolar untuk andalan tertutup enam bulan lalu yang dikalahkannya 12,1 poin pada Intelligence Index dari Artificial Analysis.
Seluruh peristiwa, dari awal hingga akhir, berlangsung kurang dari sepekan. Sumber ada di akhir artikel.
Enam hari, dalam urutan kejadiannya
20 Agustus: pencatatan tayang di OpenRouter dan bersamaan itu di dalam OpenCode, agen pemrograman berbasis terminal sumber terbuka buatan Dax Raad. OpenCode mempromosikannya sebagai gratis, praktis tanpa batas, tanpa penyimpanan data lewat jalurnya sendiri, dan menyatakan telah mengamankan kapasitas hingga 100 triliun token per hari.
21 hingga 24 Agustus: penggunaan naik setiap harinya tanpa terkecuali. Endpoint aktivitas model OpenRouter mencatat 27,0 juta permintaan pada 21 Agustus, 54,4 juta pada 22 Agustus (naik 101,2 persen), 63,9 juta pada 23 Agustus, dan 70,3 juta pada 24 Agustus.
24 Agustus: OpenCode mempublikasikan angkanya. 26 triliun token dalam empat hari pertama, dari 327.000 pengguna unik dan 8.328.244 sesi yang tuntas — rata-rata 3,2 juta token per sesi dan sekitar 25 sesi per pengguna. Itu menempatkan Ox Alpha di posisi kedua di antara model yang dilacak OpenCode, di belakang DeepSeek V4 Flash dengan 33 triliun dan di depan MiMo-V2.5 milik Xiaomi dengan 12 triliun. OpenRouter secara terpisah melaporkan 11,6 triliun token dalam tiga hari penuh pertama, menyebutnya peluncuran model terbesar dalam sejarah platform; pemegang rekor sebelumnya menghasilkan 4,4 triliun pada jendela pembuka yang sama.
25 Agustus: API model OpenRouter, diurutkan berdasarkan token yang diproses selama sepekan terakhir, menempatkan Ox Alpha di urutan pertama dari 558 model yang dikembalikan. Di luar laboratorium, belum ada yang tahu siapa pembuatnya.
26 Agustus: Z.AI mengonfirmasi kepada Bloomberg bahwa Ox Alpha adalah model baru dari seri GLM-nya. Bobotnya keluar pada malam yang sama. Tulisan peluncuran perusahaan menyebut mereka menguji GLM-5.3-Flash secara anonim sebagai ox-alpha di OpenCode dan OpenRouter "untuk mengumpulkan umpan balik pengguna", dan halaman siluman di OpenRouter diperbarui menjadi: model ini "dikembangkan dan dioperasikan oleh ZAI, terungkap sebagai ZAI GLM-5.3-Flash".
Angka trafiknya nyata. Tetapi itu bukan vonis soal kualitas.
Di sinilah sebagian besar liputan tergelincir, jadi mari kita tegaskan apa yang sebenarnya diukur oleh 26 triliun token itu.
Angka itu mengukur keluaran kerja sebuah endpoint gratis dengan jendela sejuta token, yang sebagian besar dikonsumsi agen pemrograman. Dasbor OpenCode sendiri menyebut 93 persen token masukan dilayani dari cache — konteks repositori yang sama, dibaca berulang kali sepanjang sesi yang panjang. Peringkat yang diurutkan berdasarkan token terproses memberi keunggulan mekanis raksasa kepada model mana pun yang gratis dan berjendela besar, karena kerangka agen menyuntikkan ulang konteks, mengulang panggilan alat yang gagal, dan mengembalikan keluaran alat ke dalam prompt. Sesi panjang menggelembungkan angka itu memang berdasarkan desainnya.
Angka 100 triliun token per hari perlu perlakuan yang sama. Itu adalah OpenCode yang menjelaskan kapasitas layanan agregat, bukan penggunaan yang tersalurkan dan bukan jatah per pengguna. Penggunaan nyata rata-rata sekitar 6,5 triliun token per hari selama empat hari pertama — 6,5 persen dari plafon yang diiklankan. Analis Teortaxes mencatat bahwa menghasilkan 100 triliun token keluaran per hari pada 80 token per detik akan memerlukan sekitar 580.000 setara GPU, dan itu persis jenis angka yang seharusnya membuat Anda bertanya apa yang sedang dihitung sebelum ikut menyebarkannya.
Jumlah permintaan harian dari endpoint aktivitas model OpenRouter, snapshot cache 25 Agustus 2026. Platform dapat merevisi angka-angka ini.
Jadi apa yang sebenarnya dibuktikan trafik itu? Bahwa sebuah model gratis berkelas frontier dengan jendela sejuta token, ditempatkan di dua tempat yang memang sudah dihuni agen pemrograman, akan menjenuhkan permintaan dalam 24 jam. Itu hasil distribusi, dan hasil distribusi layak dipelajari atas dasarnya sendiri. Itu tidak mengatakan apa pun tentang apakah model ini bagus di repositori Anda.
Mengapa laboratorium kini merilis model tanpa mencantumkan namanya
Inilah titik baliknya, dan kami menandainya dengan jelas: semua di atas adalah pengukuran, yang menyusul adalah pembacaan kami.
Merilis secara anonim membelikan laboratorium tiga hal yang tidak bisa diperoleh dengan cara lain. Sebut saja gabungan itu dividen anonimitas.
Yang pertama adalah evaluasi yang bersih. Setiap rilis bernama mendarat di dalam sebuah prasangka. Model dari laboratorium Tiongkok dinilai dengan tolok "mengejutkan bagus untuk model terbuka"; model dari laboratorium frontier Amerika dinilai dengan tolok "sepadankah dengan kenaikan harganya". Lepaskan namanya, dan satu-satunya yang tersisa untuk direspons pengembang adalah keluarannya. Evaluasi yang masuk selama pekan siluman itu dikerjakan orang-orang yang sama sekali tidak tahu model siapa yang mereka puji — hal termahal yang bisa direkayasa dalam pemasaran AI, dan termurah untuk diperoleh cukup dengan tidak berkata apa-apa.
Yang kedua adalah roda gila. Misterinya adalah kampanyenya. Tidak ada yang menulis artikel forensik tentang kenaikan versi rutin, tetapi sepekan penyidikan sidik jari tokenizer, analisis lapisan penyajian, dan spekulasi menghasilkan volume liputan yang luar biasa besar yang tidak perlu dibeli laboratorium. Pengungkapan itu lalu mendarat pada audiens yang sudah terlanjur peduli pada jawabannya. Z.AI mendapat sepekan perhatian gratis, lalu satu hari peluncuran dengan punchline yang sudah tertanam.
Yang ketiga adalah telemetri pada skala yang sulit dibeli dengan uang. 8,3 juta sesi agen yang tuntas, berisi pekerjaan nyata, berantakan, berbentuk produksi, adalah sebuah kumpulan data. Halaman OpenRouter Ox Alpha menyatakan bahwa prompt dan hasilnya disimpan oleh penyedia dan secara tegas tidak dipakai untuk pelatihan — kami akan kembali ke soal ini sebentar lagi. Namun penyimpanan saja sudah menghasilkan pola kegagalan, distribusi latensi, tingkat kesalahan pemanggilan alat, dan kurva degradasi pada konteks panjang, di ratusan ribu repositori nyata. Rangkaian evaluasi internal tidak akan memberi Anda itu.
Baris tentang ketentuan data itu layak diberi catatan tersendiri, sebab itulah satu-satunya hal yang benar-benar tidak lazim dalam cerita ini. Dari empat belas pencatatan siluman yang dijalankan OpenRouter sejak April 2025, tiga belas mencantumkan versi dari kalimat "prompt dan hasil dicatat oleh penyedia dan dapat digunakan untuk meningkatkan model". Hanya Ox Alpha yang justru menulis: disimpan, tidak digunakan untuk pelatihan. Apakah itu menenangkan Anda bergantung pada seberapa besar bobot yang Anda berikan pada satu baris teks di halaman model sebuah platform perutean. Yang jelas, itu pilihan yang disengaja, dan ini pertama kalinya sebuah pencatatan siluman melakukannya.
Nama sandi kini sudah menjadi genre tersendiri
Ini bukan manuver baru. Ini pola dengan lima konfirmasi sumber utama di belakangnya, dan mengetahui rekam jejak itulah yang memungkinkan Anda mengkalibrasi kasus berikutnya.
| Nama sandi | Ternyata adalah | Dikonfirmasi oleh | Tanggal | Bukti |
|---|---|---|---|---|
| Quasar Alpha | GPT-4.1, snapshot pra-rilis OpenAI | Blog OpenRouter sendiri | 14/04/2025 | Sumber utama |
| Optimus Alpha | GPT-4.1, snapshot lebih dekat ke versi final | Blog OpenRouter sendiri | 14/04/2025 | Sumber utama |
| Horizon Alpha / Horizon Beta | Checkpoint awal GPT-5 | OpenRouter, "GPT-5 is now live" | 07/08/2025 | Sumber utama |
| Sonoma Dusk Alpha / Sonoma Sky Alpha | xAI Grok 4 Fast, varian tanpa dan dengan penalaran | Hanya kesimpulan komunitas | — | Dilaporkan, belum dikonfirmasi |
| Hunter Alpha / Healer Alpha | Xiaomi MiMo | Tim MiMo Xiaomi sendiri | 18/03/2026 | Sumber utama |
| Owl Alpha | Meituan LongCat-2.0-Preview | Blog Meituan dan @Meituan_LongCat | 30/06/2026 | Sumber utama |
| Cypher Alpha / Aurora Alpha | Tidak pernah terungkap | — | — | Tidak ada |
| Ox Alpha | Z.AI GLM-5.3-Flash | Z.AI kepada Bloomberg; halaman OpenRouter diperbarui | 26/08/2026 | Sumber utama |
Dua hal muncul dari tabel itu. Tujuh dari tiga belas pencatatan historis akhirnya dikonfirmasi oleh pernyataan sumber utama, tingkat penyelesaian yang jauh lebih baik daripada yang disugerikan cerita rakyat — dan tiga di antaranya datang dari laboratoriumnya, bukan dari OpenRouter, yang menjelaskan mengapa kompilasi yang hanya memantau blog OpenRouter selalu menghitung kurang. Hal kedua, panggungnya berpindah. Baris-baris 2025 adalah OpenAI dan xAI. Baris-baris 2026 adalah Xiaomi, Meituan, dan Z.AI. Laboratorium Tiongkok tidak menemukan rilis siluman; merekalah yang mengindustrialisasikannya.
Pengungkapan: 320 miliar total, 18 miliar aktif, MIT
Sekarang spesifikasinya, diambil dari kartu model Z.AI sendiri, bukan dari ringkasan siapa pun.
GLM-5.3-Flash digambarkan para penulisnya sebagai "model multimodal native pertama dalam seri GLM-5", dengan 320 miliar parameter total dan 18 miliar aktif dalam konfigurasi mixture-of-experts, dilatih pada korpus multimodal 30 triliun token. Arsitekturnya untuk pertama kali dalam seri ini menggabungkan atensi jarang dan atensi linear, ditambah teknik yang disebut makalahnya sebagai Manifold-Constrained Hyper-Connections. Jendela konteksnya 1.048.576 token, dengan respons tunggal maksimum 131.072 token. Kedalaman penalaran diekspos lewat parameter reasoning_effort dengan pengaturan low, high, dan max, dengan max sebagai bawaan. Lisensinya MIT — bukan lisensi komunitas khusus dengan ambang jumlah pengguna, melainkan MIT.
Klaim kemampuan dari Z.AI sendiri layak dikutip persis, karena lebih terukur daripada liputan di sekelilingnya: model itu "mengungguli GLM-5.2 di seluruh tolok ukur dan beban kerja nyata dengan sepersepuluh harga, sembari mendekati Claude Opus 4.8 pada tolok ukur pemrograman dan agentik". Mendekati. Bukan mengalahkan.
Untuk pembacaan independen, Artificial Analysis kini sudah mengujinya. GLM-5.3-Flash mencetak 57 pada Artificial Analysis Intelligence Index, dibandingkan median 29 untuk model berbobot terbuka yang sebanding. Menjalankan seluruh rangkaian evaluasi itu menghabiskan 138,02 dolar biaya API — angka yang kami kutip karena inilah data tunggal paling jujur di seluruh artikel ini tentang berapa biaya menggunakan kecerdasan mendekati frontier hari ini. Evaluasi yang sama menandai dua kelemahan nyata: pada 45 token keluaran per detik model ini lambat, dan ia menghasilkan 150 juta token untuk menuntaskan indeks dibandingkan median 110 juta, yang berarti bertele-tele. Bertele-tele tetaplah tagihan, sekalipun harga per tokennya kecil.
Berita sesungguhnya adalah model kelas Flash mencapai 57
Mari jajarkan angkanya, dengan konvensi campuran 3:1 masukan terhadap keluaran yang sama seperti yang dipakai Epoch AI untuk perbandingan harga.
| Claude Opus 4.6 Max | Qwen3.8-27B | GLM-5.3-Flash | |
|---|---|---|---|
| Rilis | 05/02/2026 | 14/08/2026 | 26/08/2026 |
| Bobot | Tertutup | Apache 2.0 | MIT |
| Intelligence Index | 44,9 | 52,0 | 57 |
| Harga per 1 juta masukan | $5,00 | $0,45 | $0,15 |
| Harga per 1 juta keluaran | $25,00 | $3,20 | $0,50 |
| Campuran (3:1) | $10,00 | $1,09 | $0,24 |
Panjang batang adalah harga; angka di kanan tiap batang adalah skor kecerdasan. Artificial Analysis dan OpenRouter, diakses 31 Agustus 2026.
GLM-5.3-Flash 42 kali lebih murah daripada andalan tertutup bulan Februari dan mencetak 12,1 poin lebih tinggi pada indeks independen yang sama. Dibandingkan model terbuka 27B yang kami tulis sepuluh hari lalu, ia 4,6 kali lebih murah dan 5 poin lebih baik. Kedua jurang itu terbentuk dalam enam bulan.
Ini kurva yang sama dengan yang artikel Qwen3.8 kami ukur dari ujung yang lain: seri ambang tetap Epoch AI, yang menahan skor tolok ukur konstan dan melacak model termurah yang mencapainya, menemukan bahwa performa setara GPT-4 turun dari 37,50 dolar per juta token pada Maret 2023 menjadi 0,18 dolar pada Februari 2025 — 208 kali lebih murah dalam 23 bulan. GLM-5.3-Flash adalah wujud kurva itu ketika ia mencapai frontier saat ini, bukan frontier tiga tahun lalu.
Dan perhatikan kelasnya. Ini bukan model andalan. "Flash" dalam konvensi penamaan laboratorium mana pun berarti saudara yang murah, cepat, dan bervolume tinggi dari model yang sebenarnya ingin mereka pamerkan. Fakta yang menarik bukanlah bahwa sebuah laboratorium Tiongkok merilis model kuat. Faktanya adalah SKU hemat kini sudah cukup dekat ke frontier sehingga sepekan pengujian anonim berhadapan langsung pun tidak langsung membongkar rahasianya.
Empat hal yang tidak dapat kami verifikasi, ditandai sebagaimana adanya
Antusiasme di sekitar rilis ini mendahului bukti pada titik-titik tertentu. Inilah titik-titik tersebut.
Klaim bahwa Ox Alpha "melampaui GPT-5.6" pada pengujian konteks sejuta token berasal dari tulisan pihak ketiga, bukan dari metodologi terbit yang bisa kami periksa, dan sasaran pembanding Z.AI sendiri adalah Claude Opus 4.8, bukan GPT-5.6. Perlakukan perbandingan dengan GPT-5.6 sebagai klaim komunitas yang belum terverifikasi.
Skor 80 persen pass@1 pada DeepSWE yang banyak diulang tidak sebanding dengan angka di atas 96 persen pada SWE-bench Verified yang sering diletakkan bersebelahan di tabel yang sama. Kerangka berbeda, kumpulan tugas berbeda, tingkat kesulitan berbeda. Tabel mana pun yang menaruh keduanya di baris bersebelahan sedang menciptakan peringkat yang tidak ada.
Klaim Z.AI bahwa seluruh pekan siluman dilayani di atas akselerator domestik Tiongkok, dengan peningkatan penyajian ujung ke ujung 3x dan biaya per token setara perangkat keras NVIDIA, berasal dari vendor dan belum diaudit secara independen. Kalau terbukti, itu detail paling berkonsekuensi dalam seluruh cerita ini; untuk sekarang, itu klaim siaran pers.
Dan pratinjau gratis itu adalah subsidi, bukan tingkatan harga. Ia sudah berakhir. Harga saat ini 0,15 dan 0,50 dolar, dengan diskon promosi 50 persen yang berlaku sampai 9 September 2026 pukul 16.00 UTC — artinya angka jujur untuk kondisi mapan adalah angka tanpa diskon, dan anggarkan terhadap 0,15 / 0,50 dolar, bukan terhadap harga minggu ini.
Apa yang dilakukan 24 sen pada pipeline yang mendengar, menerjemahkan, dan meringkas
Produk suara luar biasa terpapar harga token, karena ia menghasilkan transkrip lalu membacanya berulang kali. Setiap tahap berikutnya — penghalusan, penerjemahan, peringkasan, tanya jawab — menelan ulang teks yang sama. Berikut aritmetikanya, dengan seluruh asumsi terbuka.
- Mulailah dari satu unit kerja nyata. Rapat 60 menit antara dua orang, pada sekitar 130 kata per menit, menghasilkan kira-kira 7.800 kata. Dengan label pembicara dan penanda waktu, hitung transkripnya sebagai 12.000 token.
- Tambahkan tahap peringkasan. Transkrip penuh masuk, catatan terstruktur keluar: 12.000 token masukan, sekitar 800 token keluaran.
- Tambahkan penerjemahan langsung ke tiga bahasa sasaran. Tiap tahap membaca transkrip dan menulis volume yang sebanding: 12.000 masuk dan 12.000 keluar, tiga kali.
- Jumlahkan satu rapat. 48.000 token masukan dan 36.800 token keluaran.
- Hitung harganya dua kali. Pada 0,15 / 0,50 dolar GLM-5.3-Flash, rapat itu berbiaya 2,6 sen. Pada 5,00 / 25,00 dolar Claude Opus 4.6, rapat yang sama berbiaya 1,16 dolar.
Selisih 45 kali pada satu jam audio bukanlah optimasi satu baris anggaran. Itu perbedaan antara fitur yang penggunaannya Anda takar hati-hati dan fitur yang Anda biarkan menyala secara bawaan. Pada 1,16 dolar per rapat, menerjemahkan ke tiga bahasa untuk setiap pengguna adalah keputusan yang harus disetujui seseorang di bagian keuangan. Pada 2,6 sen, itu sebuah kotak centang.
Itulah bagian dari cerita ini yang bertahan lebih lama daripada nama sandinya. Rilis siluman adalah manuver pemasaran, dan manuver yang bagus. Fakta yang lebih awet adalah bahwa tingkatan murah dalam jajaran sebuah laboratorium menengah kini menyerahkan 57 poin indeks pada harga campuran 24 sen, dengan lisensi MIT terlampir agar Anda bisa menjalankannya sendiri kalau suatu saat harganya bergerak ke arah yang salah.
Kesimpulan: frontier bukan lagi tempat harga-harga menarik berada
Selama tiga tahun, pertanyaan soal pemilihan model adalah "seberapa dekat ke frontier Anda sanggup berada". Enam hari Ox Alpha menjawab pertanyaan lain: berapa banyak kemampuan yang kini duduk di bawah kelas andalan, dihargai layaknya komoditas, dan dirilis oleh laboratorium yang cukup percaya diri untuk mengujinya dengan namanya dicopot.
Dividen anonimitas hanya cair kalau modelnya cukup bagus untuk bertahan sepekan tanpa merek. Z.AI mencairkannya. Nama sandi berikutnya yang muncul di sebuah platform perutean layak mendapat perlakuan yang sama seperti Ox Alpha: jalankan pada tugas Anda sendiri sebelum ada yang memberi tahu itu milik siapa, karena selama sepekan itulah satu-satunya evaluasi jujur yang bisa didapat siapa pun.
Di mana posisi Telli.sh: kurva inilah alasan kami membangun pipeline suara kami di atas lapisan penyedia mesin, alih-alih di sekitar API satu vendor. Telli.sh merutekan transkripsi, penerjemahan, dan peringkasan melalui mesin yang bisa ditukar, sehingga satu anak tangga turun di kurva harga ini tiba sebagai catatan yang lebih baik pada harga yang sama, bukan sebagai pengumuman perubahan tarif. Bagian yang tidak diberikan rilis model mana pun adalah sisa pekerjaannya: merekam satu jam audio tanpa kehilangan potongan, memisahkan pembicara, menerjemahkan langsung ke 15 bahasa, dan meninggalkan catatan yang masih bisa Anda cari kuartal depan.
Sumber
- Halaman model
stealth/ox-alphadi OpenRouter — tanggal pencatatan 20 Agustus 2026, konteks sejuta token, dan baris tambahan yang mengonfirmasi ZAI GLM-5.3-Flash; diakses 31 Agustus 2026 - Halaman model
z-ai/glm-5.3-flashdi OpenRouter — harga terkini dan jendela diskon promosi hingga 9 September 2026; diakses 31 Agustus 2026 - Kartu model Hugging Face, zai-org/GLM-5.3-Flash — 320 miliar parameter total / 18 miliar aktif, korpus multimodal 30 triliun token, lisensi MIT, pengaturan
reasoning_effort, dan klaim mendekati Claude Opus 4.8 - Ox Alpha anonim memproses 26 triliun token di OpenCode, memecahkan rekor peluncuran OpenRouter — RuntimeWire, 26 Agustus 2026 — 26 triliun token, 327.000 pengguna, 8.328.244 sesi, angka cache 93 persen, dan rekor 11,6 triliun token OpenRouter
- Penggunaan, spesifikasi, dan petunjuk identitas Ox Alpha — LLM Rumors, 25 Agustus 2026 — jumlah permintaan harian dan peringkat pertama dari 558 model
- Model siluman kelas frontier Ox Alpha muncul gratis di OpenRouter dan OpenCode — WinBuzzer, 24 Agustus 2026 — klaim kapasitas 100 triliun token per hari dan estimasi GPU dari Teortaxes
- Z.AI asal Tiongkok membuat model siluman Ox Alpha yang menyaingi DeepSeek — Bloomberg via Yahoo Finance, 26 Agustus 2026 — konfirmasi identitas dari sumber utama
- Model siluman yang mengalahkan DeepSeek milik Zhipu — The Next Web — liputan pengungkapan dan komitmen bobot terbuka
- Model siluman OpenRouter: ternyata milik siapa — Digital Applied, 22 Agustus 2026 — sensus empat belas pencatatan, tanggal pengungkapan, tingkat bukti, dan perbandingan ketentuan data
- Artificial Analysis: analisis kecerdasan, performa, dan harga GLM-5.3-Flash — Intelligence Index 57, biaya evaluasi 138,02 dolar, 45 token per detik, 150 juta token dihasilkan; diakses 31 Agustus 2026
- Epoch AI, "LLM inference prices have fallen rapidly but unequally across tasks", 12 Maret 2025 — tangga harga ambang tetap di balik angka 208 kali
- Perbandingan sebelum dan sesudah kami tentang kebangkitan model lokal — angka Qwen3.8-27B, kurva harga, dan jeda mengejar