Jev membuat pilihan, bukan berbual: tiga demo dan batasan di sebaliknya
Perkara yang sebenarnya dilakukan Jev daripada TypeSafe, dengan GIF Browser Use dan demo boleh main, kes X tentang 1,500 e-mel serta demo permainan rasmi. Ketahui apabila keputusan bertip membantu, apabila ia gagal dan cara menilai aliran kerja sebenar.
Rajah penerangan asal, bukannya penanda aras vendor. Model memilih dalam ruang yang ditakrifkan; kod aplikasi masih mengawal kebenaran, pengesahan dan pelaksanaan.
Pengelas peti masuk tidak perlu menulis esei sebelum memilih folder. Pengawal browser selalunya cuma perlu memilih satu butang yang tersedia, bukannya mereka cipta arahan baharu. Keputusan kecil seperti inilah yang menjadikan Jev, model System One pertama TypeSafe AI, paling menarik untuk dinilai.
TypeSafe memperkenalkan Jev pada 15 September 2026. Perbezaan yang berguna bukan sekadar kerana ia satu lagi model pantas: Jev mengembalikan keputusan terkekang dan bukannya prosa terbuka. Hal ini mengubah cara anda boleh membina program di sekelilingnya, tetapi tidak menghapuskan kemungkinan jawapan yang dipilih itu salah. Rujuk pelancaran rasmi untuk pembingkaian vendor.
Panduan ini meneliti tiga demonstrasi awam: tugas browser dengan bukti GIF dan video yang boleh dimuat turun, laporan seorang pengarang tentang pengelasan 1,500 e-mel, dan demo permainan TypeSafe. Kami juga menukarkan contoh tersebut kepada rancangan penilaian yang konkrit. Artikel kes penggunaan Tistory, diterbitkan pada 18 September, menjadi titik permulaan penyelidikan; aplikasi yang dicadangkan di dalamnya tidak dianggap sebagai penggunaan pelanggan yang disahkan secara bebas.
Ringkasnya:
- Jev boleh memilih, memberi skor atau menilai proposisi daripada teks; ia bukan pengganti model yang menulis teks sewenang-wenangnya.
- Hasil bertip yang sah masih boleh salah dari segi semantik. Kekalkan pengesahan dan kebenaran muktamad dalam kod.
- Rakaman browser itu sebenar, tetapi satu tugas bukan penanda aras umum. Contoh e-mel ialah laporan pengarang, bukannya kajian ketepatan yang diterbitkan.
- Mulakan dengan pengelasan yang boleh dibatalkan, ukur ralat menggunakan data anda sendiri dan jadikan pilihan berkecuali suatu hasil yang disokong.
Jawapan kecil memerlukan soalan yang sangat jelas
Tiga primitif teras API ialah Choice, Score dan Noul. Choice memilih daripada alternatif bernama. Score menilai aras tersusun yang diterangkan. Noul memulangkan kebarangkalian bagi proposisi ya atau tidak; nilai yang hampir di tengah menunjukkan ketidakpastian terhadap proposisi itu, bukannya aras keterukan sederhana. Dokumentasi primitif mentakrifkan kontrak ini.
Perubahan praktikalnya ialah menentukan hasil yang mungkin sebelum meminta model membuat keputusan. Daripada meminta perenggan tentang mesej sokongan yang diterima, anda boleh bertanya sama ada mesej itu mengenai pengebilan, akses akaun, kecacatan produk atau kategori yang belum dapat dipastikan. Aplikasi anda kemudian menentukan baris gilir yang patut dipaparkan. Hasilnya ibarat suis pada landasan kereta api, bukannya keseluruhan kereta api: ia membantu mengarahkan kerja tetapi tidak menyediakan setiap keupayaan yang diperlukan untuk menyiapkannya.
| Primitif | Soalan yang berguna | Tanggungjawab aplikasi |
|---|---|---|
| Choice | Baris gilir manakah antara pilihan ini paling sepadan dengan mesej tersebut? | Tentukan set pilihan yang lengkap, termasuk laluan semakan |
| Score | Sejauh manakah mesej ini sepadan dengan aras keterdesakan yang diterangkan? | Tentukan aras dan uji sama ada pengulas bersetuju |
| Noul | Adakah mesej ini secara jelas meminta pembatalan? | Tentukan kebarangkalian yang mewajarkan semakan atau tindakan boleh batal |
Menulis alternatif yang baik ialah sebahagian daripada kerja kejuruteraan. Jika dua label bertindih, pilihan yang kelihatan yakin boleh menyembunyikan masalah dalam taksonomi anda. Jika tiada label yang sesuai, memaksa pilihan menyamarkan liputan yang tidak lengkap sebagai kepastian. Pilihan semakan selalunya lebih bernilai daripada satu lagi kategori yang dinamakan secara sempit kerana ia mendedahkan bahagian kontrak keputusan yang perlu ditambah baik.
Setakat semakan pada 30 September 2026, rujukan model menyenaraikan jev-1.13.0, input teks sahaja dan harga $0.042 bagi setiap juta token input, manakala token output adalah percuma. Itulah harga token model, bukannya jumlah kos menjalankan ejen. Browser, pengekstrakan, model pembantu, percubaan semula dan semakan manusia turut perlu dimasukkan dalam belanjawan operasi.
GIF browser menunjukkan carian sebenar, bukan tempahan penerbangan
Repositori awam jev-ultrafast oleh Browser Use menyertakan tugas Google Flights yang dirakam dari Zurich ke London. Jev memilih operasi dan sasaran daripada perwakilan halaman semasa. Pembantu generatif yang berasingan membekalkan teks apabila operasi terpilih memerlukannya. Ini sistem gubahan, bukannya bukti bahawa Jev sendiri menjana setiap rentetan atau mentafsir bingkai video.

GIF sebenar yang dirakam pengarang Browser Use, dipatok pada komit 1231850a0bf1a0c0341fe408ef1668dbbfdfac46. Hak cipta 2026 Browser Use, lesen MIT. Ia menunjukkan aliran carian, bukannya pembelian. Rakaman yang sama boleh dimainkan di bawah.
MP4 pengarang, dipaparkan pada kelajuan rakaman dengan kawalan browser. Rakaman asal dan nota pengukuran; lesen MIT yang dikekalkan. Kami memeriksa artifak awam; kami tidak mengulangi penanda aras ini.
Masa penyelesaian yang diukur oleh pengarang bagi rakaman itu ialah 7.073 saat. Jam bermula pada ramalan pertama selepas pemerhatian halaman utama awal, bukannya ketika browser baharu dilancarkan. Persediaan, navigasi awal dan pengesahan bebas baharu selepas larian tidak termasuk dalam sela masa yang diukur itu. Hasil carian disemak; tiada tiket dipilih atau dibeli. Batasan ini penting untuk memahami maksud angka tersebut.
Laporan yang sama membandingkan enam larian berselang-seli, tiga untuk setiap runtime. Median masa tugas berubah daripada 9.450 saat kepada 7.092 saat, manakala median panggilan protokol browser turun daripada 1,092 kepada 101. Kedua-dua kumpulan menggunakan Jev dan pembantu teks yang sama, maka ini terutamanya perbandingan runtime, bukannya persaingan antara dua keluarga model. Pengarang secara jelas menyebut sampel kecil dan kebolehubahan web langsung dalam laporan prestasi.
Pada pandangan kami, gelung browser di sekelilingnya sama penting dengan model. Mengumpulkan halaman berulang kali, menentukan sasaran dan membatalkan keputusan boleh menelan kos lebih tinggi daripada yang kelihatan pada klik mudah. Enjin keputusan yang lebih pantas tidak mengimbangi penerangan butang yang tidak boleh dipercayai untuk dipilih. Repositori itu mengekalkan pengesahan hasil secara bebas kerana dakwaan model bahawa tugas telah selesai bukan bukti penyelesaian.
Di sinilah batasan demo berguna. Pelaksanaan yang didokumenkan tidak meliputi setiap bingkai, kanvas, aliran muat naik atau widget papan kekunci sewenang-wenangnya. Pasukan yang menilainya patut menghasilkan semula tugas dan laluan kegagalan yang mewakili kerja mereka sendiri, bukannya menyimpulkan bahawa carian penerbangan yang berjaya membuktikan kecekapan browser umum. Anggap rakaman itu sebagai bukti yang boleh diperiksa bagi satu gubahan yang berfungsi.
Catatan 1,500 e-mel ialah kes yang menarik tetapi tanpa penyebut
Pada 16 September 2026, vogel (@ryanvogel) menyiarkan di X bahawa beliau telah mencuba Jev pada 1,500 e-melnya sendiri dan kagum dengan hasil pengelasannya. Catatan asal itu menyertakan video. Ini contoh pengguna sebenar yang berguna kerana beban kerjanya konkrit dan sumbernya ialah orang yang melaporkan eksperimen, bukannya senarai aplikasi hipotetikal tanpa atribusi.
Namun begitu, ini bukan laporan ketepatan. Catatan itu tidak membuktikan adanya set ujian berlabel awam, kadar ralat yang diukur, persetujuan antara pengulas atau kos kesilapan. Bilangan mesej yang diproses memberitahu skala eksperimen, bukannya ketepatannya. Pembaca patut menonton demo X asal sambil memahami perbezaan ini; videonya dipautkan dan tidak disalin tanpa lesen pengedaran semula.
Walau bagaimanapun, pengelasan e-mel ialah tempat yang munasabah untuk memulakan penilaian kerana prosesnya boleh dibatalkan. Paparkan label yang dicadangkan di sebelah peti masuk sedia ada, biarkan mesej asal tanpa perubahan dan rekodkan pembetulan. Bandingkan pasangan yang mengelirukan seperti invois dengan peringatan pembayaran, atau permintaan pembatalan dengan aduan yang sekadar menyebut pembatalan. Kes sedemikian mendedahkan sama ada kategori itu sepadan dengan aliran kerja sebenar anda.
Penggunaan awal tidak sepatutnya memadam e-mel, menghantar balasan atau meluluskan transaksi secara automatik hanya kerana pengelasan kelihatan meyakinkan. Tindakan itu melibatkan kebenaran dan akibat yang berbeza. Mulakan dengan cadangan atau baris gilir semakan; hanya naik taraf kepada tindakan yang terhad selepas corak ralatnya diukur. Ini prosedur penilaian cadangan kami, bukannya dakwaan tentang pelaksanaan pengarang X.
Doom dan Wikiracing menjadikan gelung keputusan mudah dilihat
Pelancaran TypeSafe menyertakan demo Doom dan demo Wikiracing, kedua-duanya dipautkan daripada artikel pelancaran rasmi. Demo tersebut ialah penerangan visual yang berguna tentang keputusan berulang. Ia bukan bukti bahawa Jev model visual serba guna atau boleh menyelesaikan masalah perancangan sewenang-wenangnya.
Dalam contoh Doom, model menerima penerangan keadaan berstruktur dalam bentuk teks, bukannya tangkap layar. Dalam Wikiracing, model memilih daripada pautan yang tersedia dan bukannya mereka URL destinasi. Mekanisme menariknya ialah kitaran pemerhatian, pilihan terbatas dan tindakan yang berulang. Demo permainan memudahkan kitaran itu dilihat, sambil persoalan tentang pemindahannya ke persekitaran lain kekal terbuka.
Pemisahan yang sama muncul dalam dokumentasi demo rumah pintar TypeSafe. Soalan berlainan boleh mengelaskan aspek permintaan, sementara komponen lain mengendalikan perbualan bebas atau memecahkan permintaan berbilang bahagian. Jangan gambarkan seni bina itu sebagai satu model yang menjana bahasa dan melaksanakan setiap keputusan. Nama seperti pembantu atau ejen sering menyembunyikan sempadan ini melainkan pelaksanaannya menjelaskannya.
Rajah asal berdasarkan kontrak fan-out yang didokumenkan. Soalan serentak berkongsi keadaan; soalan-soalan itu tidak membaca jawapan satu sama lain secara tersembunyi.
Corak fan-out boleh mengurangkan masa menunggu bersiri apabila beberapa soalan bergantung pada sumber yang sama. Contohnya, topik mesej dan sama ada mesej itu secara jelas meminta panggilan balik boleh dinilai secara bebas. Soalan yang bergantung pada topik yang baru dipilih tidak boleh mengandaikan jawapan itu sudah tersedia dalam panggilan yang sama. Pisahkan kebergantungan itu kepada langkah kemudian atau gabungkan hasil bebas secara deterministik dalam kod.
Jawapan bertip bukanlah jawapan yang betul secara automatik
Tafsiran paling berbahaya terhadap model terkekang ialah jawapan yang tersusun dengan betul pasti tidak salah. Ia boleh salah. Pengelas boleh memilih label dibenarkan yang tidak sesuai, dan pemilih tindakan boleh memilih butang sah pada borang yang salah. Menghapuskan prosa cacat daripada antara muka memang berguna, tetapi ia menangani kelas kegagalan yang berbeza daripada salah faham terhadap tugas.
Nota jaggedness Jev 1.13 TypeSafe, kali terakhir disemak pada 17 September, menghuraikan kelemahan berkaitan aritmetik, pengiraan, perbandingan tarikh, konteks yang mengganggu dan input adversarial. Untuk perbandingan tepat, huraikan tarikh dan hitung kuantiti menggunakan kod biasa. Jangan tukar peraturan deterministik menjadi pertimbangan semantik hanya kerana model boleh menerima soalannya.
Dokumentasi keyakinan turut penting: Choice dan Score mendedahkan taburan kebarangkalian serta nilai keyakinan terbitan; Noul tidak mempunyai medan keyakinan berasingan. Angka itu bukan kebarangkalian universal bahawa jawapan adalah betul. Ambang perlu disahkan berasaskan tugas anda sendiri, terutamanya apabila akibat positif palsu berbeza daripada negatif palsu.
Rajah penilaian asal. Melepasi satu pintu tidak bermaksud pintu berikutnya turut dilepasi; output yang dibenarkan masih memerlukan tafsiran yang betul dan tindakan yang dibenarkan.
Bagi kerja berbilang bahasa, uji setiap bahasa yang benar-benar anda kendalikan. Dokumentasi model menyatakan bahasa Inggeris ialah bahasa latihan utama dan mutunya tidak seragam dalam bahasa lain, termasuk skrip CJK. Oleh itu, baris gilir sokongan bahasa Korea atau arkib surat berita pelbagai bahasa patut menjadi segmen penilaian tersendiri, bukannya sambungan yang diandaikan daripada skor bahasa Inggeris. Terjemahan juga boleh mengubah bukti, maka kekalkan teks asal jika menilai perwakilan terjemahan.
Bina percubaan yang boleh gagal dengan jujur
Rintis yang berguna bermula dengan keputusan yang boleh dilabel secara konsisten oleh pasukan anda. Pilih tugas boleh batal seperti mencadangkan baris gilir sokongan, menandakan kemungkinan pendua atau melabel dokumen untuk semakan kemudian. Jangan mentakrif kejayaan berdasarkan kelancaran demo. Takrifkan hasil salah yang akan anda kesan, yang mungkin terlepas dan kos setiap satunya kepada pengguna.
- Tulis kontrak keputusan. Senaraikan hasil yang mungkin, medan sumber yang diperlukan dan pilihan semakan. Asingkan tafsiran semantik daripada pengiraan dan kebenaran.
- Cipta set penilaian. Gunakan bahan yang anda dibenarkan untuk proses. Sertakan item biasa, sempadan samar, bahasa bercampur, medan kosong dan arahan berniat jahat dalam teks sumber.
- Asingkan sebahagian data untuk ujian pegangan. Laraskan kriteria menggunakan satu set, kemudian ukur pada bahan yang tidak membentuk perumusannya. Rekodkan perselisihan dan bukannya mentakrif semula jawapan dijangka secara senyap.
- Ukur aliran kerja. Jejaki ralat mengikut kategori, kadar semakan, kependaman hujung ke hujung, percubaan semula dan jumlah kos. Panggilan model pantas dalam gelung perolehan data yang perlahan tetap menghasilkan produk yang perlahan.
- Jalankan dalam mod cadangan. Log pilihan yang dibuat, kebarangkalian berkaitan, versi model dan pembetulan manusia tanpa melaksanakan tindakan yang berakibat secara automatik.
- Naik taraf satu tindakan terbatas. Minta kebenaran nyata apabila bersesuaian, kekalkan jejak audit dan sediakan laluan undur apabila sumber atau versi model berubah.
Prosedur ini sengaja lebih ketat daripada menonton rakaman. Ia bertanya sama ada model membantu dengan taburan kes anda, termasuk kes yang janggal. Kadar semakan yang kelihatan tinggi mungkin lebih baik daripada sebilangan kecil kesilapan senyap yang mahal. Tentukan pertukaran itu sebelum memilih ambang, bukannya selepas insiden berlaku.
Patok versi untuk penilaian yang boleh dihasilkan semula dan rekodkan versi yang dipulangkan bersama setiap hasil. Alias bergerak memudahkan penerokaan tetapi boleh mengubah tingkah laku tanpa perubahan kod sumber dalam aplikasi. Artifak penilaian sepatutnya membolehkan orang lain membina semula kriteria, input, hasil dijangka dan sempadan pelaksanaan. Begitulah eksperimen yang menjanjikan menjadi ciri yang boleh diselenggara dan bukannya himpunan klip yang mengagumkan.
Kesimpulannya: letakkan pertimbangan dalam kontrak terbatas
Jev paling menarik apabila membuat keputusan kecil yang boleh diperiksa dalam program yang sudah mengetahui peraturannya. Video browser menunjukkan gubahan yang berfungsi, catatan e-mel membekalkan eksperimen konkrit yang wajar diuji, dan demo rasmi mendedahkan gelung itu. Soalan seterusnya bukan sama ada model boleh memilih jawapan, tetapi sama ada sistem anda dapat mengenali pilihan yang buruk sebelum ia membawa akibat.
Sumber dan kredit media
- TypeSafe: Memperkenalkan Model System One dan Jev, 15 September 2026; konteks pelancaran rasmi dan video permainan.
- Browser Use: jev-ultrafast, sumber berpaksikan komit yang disemak pada 30 September 2026. GIF dan MP4 hak cipta 2026 Browser Use, lesen MIT; tiada pertalian yang tersirat.
- Browser Use: ukuran rakaman dan larian sepadan, disemak 30 September 2026; ukuran pengarang, bukan penghasilan semula kami.
- vogel di X: eksperimen pengelasan 1,500 e-mel, 16 September 2026; kes penggunaan laporan sendiri dengan video asal.
- Primitif TypeSafe, model, keyakinan, fan-out dan demo rumah pintar, disemak 30 September 2026.
- Jaggedness Jev 1.13, kali terakhir disemak 17 September 2026; disemak 30 September.
- Artikel kes penggunaan Jev di Tistory, 18 September 2026; titik permulaan penyelidikan, bukan pengesahan penggunaan.
Simpan bukti bersama nota anda
Apabila menyelidik model baharu, kekalkan sumber, tarikhnya dan perkara sebenar yang dibuktikan oleh demonstrasi. Cipta akaun Telli.sh untuk menyusun bahan penyelidikan dan nota terbitan anda tanpa mengelirukan ringkasan dengan bukti asal.