Google memajukan terjemahan langsung, OpenAI membuka API suara full-duplex: apa yang tersisa setelah percakapan?
GPT-Live-1 hadir di API dengan harga $0,05 per menit suara, tiga bulan setelah terjemahan suara langsung 70 bahasa dari Google. Apa yang diukur oleh harga dan benchmark yang dipublikasikan, apa yang tidak, dan mengapa notulen, ide bersama, serta sumber yang disimpan makin penting saat percakapan makin mudah.
Ilustrasi konseptual asli. Percakapan yang lebih alami dan catatan berguna dari percakapan tersebut merupakan tujuan desain yang saling melengkapi, bukan tahapan terukur dalam peluncuran produk.
Hal paling menggembirakan dari pengumuman AI suara terbaru adalah kemungkinan yang sangat sehari-hari: menyelesaikan pikiran dalam bahasa sendiri, memperjelasnya di tengah ucapan, dan tetap terlibat dengan alami. Lebih sedikit menunggu terjemahan dan mengulang kalimat dalam hati sebelum berani bicara. Perhatian pun bisa lebih terarah pada maksud lawan bicara.
Google memperkenalkan Gemini 3.5 Live Translate pada 9 Juni 2026. OpenAI memperkenalkan model GPT-Live dupleks penuhnya di ChatGPT pada 8 Juli, lalu merilis GPT-Live-1 di API pada 10 September. Ini adalah produk berbeda yang memiliki tujuan berbeda, namun urutannya mengarah ke lebih banyak interaksi lisan yang terus menerus. Pengumuman terbaru OpenAI memperluas akses bagi pengembang; ini bukan kemunculan pertama GPT-Live. Pengumuman Google bulan Juni, pengenalan OpenAI di bulan Juli, rilis API bulan September OpenAI.
Menurut saya, kemajuan ini mendekatkan dunia dengan hambatan bahasa yang lebih kecil dalam keseharian. Namun, pertanyaan berikutnya menjadi penting: ketika percakapan semakin mudah, bagaimana kita menyimpan nilai yang dihasilkannya? Notulen, ide yang dibagikan, dan sumber tersimpan adalah bagian dari jawabannya.
Suara full-duplex mengubah cara menunggu dalam percakapan
Full-duplex berarti sistem dapat mendengarkan dan berbicara pada saat yang bersamaan. OpenAI mendeskripsikan GPT-Live-1 seperti ini dalam dokumentasi modelnya saat ini, serta kemampuan untuk mendelegasikan alasan dan penggunaan alat ke agen backend. Itu adalah pernyataan tentang interaksi simultan, bukan sertifikat terjemahan sempurna. Dokumentasi model GPT-Live-1, diperiksa 11 September 2026.
Bayangkan mengoreksi seorang asisten saat dia menjelaskan sebuah rencana: “Sebenarnya, pelanggan berada di Madrid, bukan Mexico City.” Antarmuka lisan yang berguna perlu memperhatikan koreksi tersebut sebelum melanjutkan dengan asumsi yang salah. Hal ini juga perlu membedakan koreksi dari pengakuan singkat, atau jeda untuk berpikir dari ajakan untuk mengambil alih. Kualitas pertukaran bergantung pada penilaian kecil tersebut.
Antarmuka suara lama sering kali membuat struktur belokannya terlihat jelas. Anda berbicara, menunggu pemrosesan, mendengarkan, lalu mencoba lagi. Pemrosesan yang lebih cepat membantu, namun interaksi masih terasa canggung ketika sistem menebak bahwa Anda selesai terlalu dini. Desain full-duplex mengatasi tumpang tindih itu sendiri, daripada memperlakukan setiap momen pembicaraan sebagai pesan tertutup yang rapi.
Sudah ada sinyal konkrit, meskipun terbatas, mengenai mengapa hal ini penting. OpenAI melaporkan bahwa perusahaan pembelajaran bahasa Speak mengalami gangguan hampir 80% lebih sedikit selama jeda berpikir pelajar dalam evaluasi awal dibandingkan sistem berbasis giliran sebelumnya. Itu adalah hasil mitra yang dilaporkan oleh vendor, bukan temuan independen untuk setiap bahasa atau pengaturan. Ini mengukur perilaku interupsi, bukan peningkatan akurasi terjemahan sebesar 80%. Laporan peluncuran API OpenAI, 10 September 2026.
Angka-angka OpenAI yang lebih luas menunjukkan arah yang sama, dengan batasan yang sama pula. OpenAI melaporkan bahwa GPT-Live-1 meraih skor 30 poin persentase lebih tinggi daripada GPT-Realtime-2.1 di Full Duplex Bench, tes yang mengukur jeda, pergantian giliran bicara, interupsi, dan respons singkat seperti “hmm” atau “iya” saat mendengarkan. Jika dipasangkan dengan GPT-6 Astra pada tingkat penalaran menengah, model ini menempati peringkat pertama di Tau3, yang menilai tugas layanan pelanggan dan perbankan secara lisan dengan Pass@1, termasuk 97 tugas pengetahuan perbankan. Keduanya adalah evaluasi OpenAI sendiri atas perilaku percakapan dan penyelesaian tugas; tidak satu pun merupakan skor akurasi terjemahan. Ringkasan evaluasi OpenAI, 10 September 2026.
Bagi seseorang yang berbicara dalam bahasa kedua, jeda berpikir mungkin merupakan saat dimana partisipasi menjadi sulit. Seorang asisten yang menunggu dengan tepat meninggalkan ruang untuk menemukan kata. Asisten yang menerima koreksi membuatnya lebih murah untuk dicoba. Ini adalah alasan praktis untuk merasa tertarik dengan interaksi suara alami selain betapa mengesankannya suara demonstrasi.
Waktu konseptual saja; bilah tidak mewakili latensi terukur. Full-duplex menggambarkan input dan output secara bersamaan, sedangkan penanganan interupsi yang berguna masih bergantung pada model dan aplikasi.
Penerjemah langsung dan asisten percakapan punya tugas berbeda
Pengumuman Google pada bulan Juni menjelaskan terjemahan ucapan berkelanjutan dalam lebih dari 70 bahasa. Model ini menghasilkan terjemahan ucapan sambil mendengarkan, menyeimbangkan kebutuhan akan lebih banyak konteks dan tetap dekat dengan pembicara. Google mengatakan masih tertinggal beberapa detik, yang merupakan ekspektasi yang lebih berguna daripada membayangkan nol penundaan. Rilis pengembang adalah pratinjau publik. Deskripsi peluncuran Google, 9 Juni 2026.
Angka skala dalam pengumuman tersebut cukup spesifik. Terjemahan suara di Google Meet akan berkembang dari 5 bahasa yang didukung menjadi lebih dari 70, dan dari hanya menerjemahkan ke dan dari bahasa Inggris menjadi lebih dari 2.000 kombinasi bahasa dalam satu rapat. Fitur ini dimulai sebagai pratinjau privat untuk pelanggan Workspace bisnis tertentu, dengan peluncuran yang lebih luas menyusul pada akhir 2026. Grab sedang menguji model ini untuk penjemputan antara pengemudi dan penumpang, kasus penggunaan dengan lebih dari 10 juta panggilan suara per bulan. Pengumuman itu mengutip pujian mitra atas kualitas, akurasi, dan latensi rendah tanpa memublikasikan skor numerik. Angka peluncuran Google, 9 Juni 2026.
Ada perbedaan yang perlu diperhatikan. Panduan Terjemahan Langsung Google menjelaskan penerjemah yang memproses aliran audio secara terus-menerus, dengan pengaturan khusus terjemahan dan tidak ada dukungan untuk alat atau instruksi umum. GPT-Live-1 adalah model percakapan yang dapat bekerja dengan agen terpisah. Seseorang membantu menyampaikan maksud pembicara ke dalam bahasa lain; yang lain berpartisipasi dalam pertukaran. Layanan-layanan tersebut tidak boleh disajikan sebagai layanan yang dapat dipertukarkan. Panduan Terjemahan Langsung Google, dokumentasi model OpenAI, diperiksa pada 11 September 2026.
| Tonggak Sejarah | Apa yang diumumkan | Apa yang tidak ditetapkan |
|---|---|---|
| Google, 9 Juni 2026 | Gemini 3.5 Live Translate; terjemahan ucapan berkelanjutan; pratinjau publik pengembang | Kualitas yang sama untuk setiap pasangan bahasa atau akses langsung di setiap produk Google |
| OpenAI, 8 Juli 2026 | Peluncuran GPT-Live di ChatGPT, dengan mendengarkan dan berbicara secara bersamaan | Akurasi tingkat juru bahasa universal |
| OpenAI, 10 September 2026 | Akses API GPT-Live-1 untuk membangun aplikasi suara | Integrasi otomatis ke dalam setiap pertemuan atau layanan pencatatan |
Cakupan rilis berasal dari tiga pengumuman yang ditautkan di atas. Ini adalah garis waktu, bukan peringkat kinerja.
Secara keseluruhan, perkembangan ini membuat arah yang menarik terlihat: penerjemahan bisa menjadi lebih berkesinambungan, dan interaksi dengan asisten menjadi tidak terlalu kaku. Menghubungkan kemampuan tersebut ke dalam pengalaman pertemuan multibahasa yang andal tetap menjadi pekerjaan aplikasi. Seseorang masih harus memutuskan audio siapa yang ditafsirkan, ke mana hasilnya, bagaimana penanganan koreksi, dan apa yang dilihat peserta.
Angka yang dipublikasikan: $0,05 per menit, tanpa skor akurasi
Satu menit suara GPT-Live-1 di API berharga $0,05, ditagih per detik tanpa pembulatan ke atas menjadi satu menit penuh. Harga itu hanya mencakup lapisan suara di depan; model backend dan alat yang menerima delegasi dari sesi tersebut ditagih terpisah dengan tarif normalnya. Dokumentasi model OpenAI, diperiksa 11 September 2026.
Hitungannya mudah, tetapi juga mudah disalahartikan. Sesi 30 menit memakan biaya $1,50 untuk lapisan suara, satu jam $3,00, dan 100 jam per bulan mencapai $300 sebelum biaya penalaran backend. Aplikasi yang memberi setiap peserta rapat sesi terpisah akan melipatgandakan angka tersebut sesuai jumlah sesi. Pengumuman Google bulan Juni tidak mencantumkan harga untuk Gemini 3.5 Live Translate, sehingga artikel ini tidak membandingkan keduanya dari segi biaya.
| Angka | Nilai | Sumber dan tanggal | Yang diukur |
|---|---|---|---|
| Harga API GPT-Live-1 | $0,05 per menit, ditagih per detik | OpenAI, 10 September 2026 | Hanya lapisan suara; model backend dan alat ditagih terpisah |
| Full Duplex Bench | +30 poin persentase dibanding GPT-Realtime-2.1 | OpenAI, 10 September 2026 | Jeda, pergantian giliran, dan interupsi, bukan terjemahan |
| Tau3 | Peringkat pertama, bersama GPT-6 Astra (menengah) | OpenAI, 10 September 2026 | Keberhasilan tugas lisan (Pass@1), termasuk 97 tugas perbankan |
| Evaluasi awal Speak | Interupsi hampir 80% lebih sedikit saat jeda berpikir | OpenAI (kutipan mitra), 10 September 2026 | Perilaku interupsi dibanding sistem berbasis giliran sebelumnya |
| Penggunaan suara ChatGPT | Lebih dari 150 juta orang per minggu | OpenAI, 8 Juli 2026 | Penggunaan Voice dan Dictation, bukan kualitas |
| Gemini 3.5 Live Translate | 70+ bahasa, terdeteksi otomatis | Google, 9 Juni 2026 | Cakupan, bukan kualitas per pasangan bahasa |
| Terjemahan suara Google Meet | 5 → 70+ bahasa; 2.000+ kombinasi per rapat | Google, 9 Juni 2026 | Peningkatan yang direncanakan, diawali pratinjau privat |
| Latensi terjemahan | “Hanya beberapa detik di belakang pembicara” | Google, 9 Juni 2026 | Deskripsi vendor, bukan angka terukur |
Semua angka dilaporkan oleh vendor dan berasal dari pengumuman serta dokumentasi yang ditautkan dalam artikel ini. Tidak satu pun merupakan skor akurasi terjemahan berbentuk angka, seperti penilaian manusia atau metrik otomatis untuk satu pasangan bahasa.
Celah itu paling penting bagi siapa pun yang sedang memilih alat untuk rapat multibahasa. Benchmark interaksi memberi tahu apakah sebuah sistem bisa menunggu, mendengarkan, dan pulih dengan baik; benchmark itu tidak memberi tahu apakah kata “Senin” tetap benar setelah diterjemahkan ke bahasa Korea. Catatan OpenAI pada Juli tentang aksen yang tidak seperti penutur asli pada beberapa bahasa, serta tidak adanya skor per pasangan bahasa dari Google, mengarah pada aturan praktis yang sama: uji pasangan bahasa yang benar-benar dipakai tim Anda sebelum mengandalkan salah satunya untuk mengambil keputusan.
Mengurangi hambatan bahasa dimulai dari keberanian berbicara
Pertimbangkan pertemuan proyek hipotetis selama 30 menit dengan empat orang yang paling nyaman dalam tiga bahasa berbeda. Manfaat terjemahan lisan yang lebih baik bukan hanya membuat setiap orang mendengar lebih banyak kata. Hal ini agar kelompok dapat mengajukan pertanyaan lanjutan sebelum ketidakpastian menjadi kesalahpahaman. Sebuah ide tentatif dapat diungkapkan tanpa terlebih dahulu dipoles ke dalam bahasa kedua.
Hal ini mengubah ekonomi partisipasi dalam pengertian yang sangat sederhana: berkontribusi membutuhkan lebih sedikit usaha. Orang pendiam dengan pengalaman relevan mempunyai cara lain untuk berdiskusi. Orang yang memimpin rapat dapat menghabiskan lebih sedikit waktu untuk menyusun kembali kalimat yang terputus. Klarifikasi bisa terjadi bila bermanfaat, sementara semua orang masih ingat pokok pembicaraan.
Saya berharap hal ini penting dalam tim jarak jauh, diskusi kelas, percakapan pelanggan, dan pertukaran informal saat bepergian. Ini adalah ekspektasi mengenai manfaat teknologi, bukan klaim bahwa pengalaman yang sama sudah tersedia bagi semua orang. Pasangan bahasa, aksen, kosa kata, kualitas mikrofon, dan produk di sekitarnya semuanya tetap menjadi bagian dari hasilnya.
Suara yang terdengar alami perlu dinilai terpisah dari ketepatan maknanya. Dalam pengumuman Juli, OpenAI menyebut adanya aksen yang tidak seperti penutur asli atau keterbatasan kelancaran pada beberapa bahasa. Karena itu, bahasa yang benar-benar digunakan perlu diuji, bukan dinilai dari satu demo bahasa Inggris yang mulus. Catatan tersebut berlaku saat peluncuran, bukan penilaian terbaru atas semua penerapan pada September. Pengantar GPT-Live dan peringatan bahasa OpenAI, 8 Juli 2026
Ambisi yang tepat adalah partisipasi yang lebih luas dengan cara klarifikasi yang mudah. Tanggal, jumlah, nama seseorang, atau janji bersyarat harus mudah diperiksa. Sebuah sistem dapat terdengar percaya diri sementara peserta masih perlu mengatakan, “Tolong tunjukkan kalimat itu.” Memperlihatkan teks dan menyimpan teks asli, yang telah disetujui oleh peserta untuk direkam, memberikan permintaan tersebut ke suatu tempat untuk dituju.
Rapat yang lancar tetap membutuhkan catatan keputusan
Kembali ke rapat hipotetis tadi. Seseorang mengusulkan rilis pada Jumat jika pemeriksaan keamanan sudah selesai. Orang lain memilih Senin agar tim dukungan punya lebih banyak waktu untuk bersiap. Kelompok menyepakati Senin dan menunjuk penanggung jawab, tetapi satu prasyarat masih belum terselesaikan. Ringkasan yang hanya mencatat Jumat sebagai usulan awal melewatkan keputusan rapat.
Tidak ada peningkatan ritme percakapan yang dapat menghilangkan perbedaan antara saran, kondisi, dan keputusan. Orang yang bekerja dalam bahasa yang sama sudah perlu membedakannya. Interaksi multibahasa menjadikan lebih berharga untuk melestarikan jalur dari pernyataan asli ke kata-kata yang diterjemahkan dan tindakan akhir yang disepakati.
Untuk catatan pertemuan praktis, saya ingin pembaca yang melewatkan panggilan tersebut menemukan tiga hal dengan cepat: apa yang diputuskan kelompok, siapa yang bertanggung jawab untuk langkah selanjutnya, dan pertanyaan mana yang masih terbuka. Batas waktu harus digambarkan sebagai disepakati hanya jika telah disepakati. Jika sumbernya tidak jelas, catatan tersebut harus meneruskan ketidakpastian tersebut dan bukannya menjadikannya sebuah kesimpulan yang salah.
Hal ini tidak mengharuskan Anda mengubah setiap percakapan menjadi arsip yang lengkap. Catatan keputusan yang singkat bisa lebih berguna daripada halaman-halaman transkrip yang tidak dapat dibedakan. Hubungan yang penting adalah antara penjelasan singkat dan materi pendukung: kata-kata asli yang relevan, rekaman jika tersedia dan disahkan, dan dokumen yang sedang didiskusikan oleh kelompok.
Keterkaitan itu juga memudahkan perbaikan kesalahan. Peserta dapat menunjukkan ucapan asli, memperbaiki ringkasan, lalu membagikan keputusan yang sudah dikoreksi. Tanpa hubungan tersebut, orang berikutnya bisa terus meringkas ringkasan hingga salah paham awal dianggap sebagai fakta yang pasti. Interaksi suara yang lebih baik memudahkan percakapan; catatan yang baik memungkinkan hasilnya diperiksa kemudian.
Ide yang dibagikan perlu disertai sumbernya
Ide yang berguna jarang dimulai dan diakhiri dalam satu panggilan. Seseorang menemukan sebuah artikel, menyimpan sebuah bagian, mengajukan pertanyaan tentang artikel tersebut, dan membawa pertanyaan tersebut ke sebuah pertemuan. Orang lain menambahkan contoh tandingan dari video atau makalah penelitian. Langkah selanjutnya bergantung pada kemampuan menghubungkan kembali bagian-bagian tersebut setelah percakapan berakhir.
Itulah sebabnya menyimpan sumber dari web tetap berguna meskipun AI suara sudah sangat baik. URL membawa kita kembali ke sumber asli, kutipan yang dipilih menunjukkan bagian penting, dan catatan pribadi menjelaskan alasan menyimpannya. Setiap unsur punya peran berbeda. Bersama-sama, semuanya menyampaikan ide dengan lebih utuh dibandingkan satu paragraf buatan AI yang diteruskan begitu saja.
“Kita perlu mengubah pengalaman awal pengguna baru” belum memberi cukup konteks untuk melanjutkan pekerjaan. “Artikel ini membuat kami mempertanyakan lima menit pertama; berikut kutipannya, pembahasan kami, dan eksperimen yang disepakati” menyediakan bahan untuk ditinjau. Contoh ini hipotetis, tetapi perbedaannya nyata: kesimpulan saja meminta kepercayaan; alasan dan sumber memungkinkan diskusi berlanjut.
Disiplin yang sama melindungi sumber agar tidak dikaburkan menjadi komentar. Kutipan harus tetap dapat diidentifikasi sebagai kutipan. Terjemahan adalah interpretasi dari sumber tersebut, dan ringkasan pertemuan adalah pandangan turunan lainnya. Dengan menjaga agar peran-peran tersebut tetap terlihat, orang-orang akan bisa berselisih paham secara produktif tanpa terlebih dahulu harus merekonstruksi apa yang dikatakan orang lain.
Alur kerja asli yang diusulkan. Pertahankan materi sumber resmi, jadikan teks turunan dapat diperbaiki, dan pertahankan koneksi tetap terlihat saat berbagi. Diagram tersebut tidak mengklaim bahwa setiap tautan merupakan fitur otomatis saat ini.
Konteks perlu tetap tersedia setelah panggilan
Sistem suara juga mulai memisahkan percakapan dari pekerjaan yang terjadi di baliknya. Dokumentasi delegasi OpenAI menjelaskan bahwa pidato langsung dan pekerjaan yang didelegasikan dapat dilanjutkan secara independen; respons backend yang lengkap tidak membuktikan bahwa pengguna mendengar jawabannya. Ini adalah pengingat teknik yang berguna tentang masalah produk yang lebih luas: pengalaman lisan dan hasil yang tahan lama adalah hal terpisah yang perlu diverifikasi. Dokumentasi delegasi OpenAI, diperiksa 11 September 2026.
Untuk pengguna sehari-hari, pertanyaannya lebih sederhana. Ketika panggilan berakhir, dapatkah saya mengambil keputusan besok? Bisakah rekan kerja memahami alasan kami membuatnya? Bisakah saya kembali ke artikel yang menantang asumsi kami, tanpa menelusuri riwayat obrolan, browser, dan rekaman? Pertanyaan-pertanyaan itu tetap ada meski setiap kalimat ditafsirkan dengan indah.
Ada alasan untuk merasa optimis terhadap berkurangnya hambatan bahasa. Kita harus menyambut baik alat yang memungkinkan lebih banyak orang berkontribusi dengan nyaman. Harapan saya adalah percakapan yang lebih mudah akan meningkatkan nilai dalam menghubungkan apa yang kita katakan dengan apa yang kita simpan, bagikan, dan pada akhirnya kita lakukan. Pertemuan tidak harus berlangsung selamanya; hasil yang bermanfaat harus dapat bertahan.
Arah pengembangan yang kami inginkan untuk Telli.sh
Bagi Telli.sh, arahnya adalah membantu mengubah percakapan dan penemuan menjadi pengetahuan yang dapat ditemukan kembali. Kini produk menyatukan catatan, rekaman, terjemahan, dan Clip dalam satu ruang kerja. Berikutnya, kami ingin memperkuat hubungan antarmateri agar notulen, ide, dan sumbernya tidak kembali terpencar.
Kami menginginkan alur yang berkesinambungan: merekam percakapan dengan izin yang diperlukan, meninjau poin penting, memperjelas keputusan, lalu membagikan ide beserta bahan pendukungnya. Jika diskusi dimulai dari halaman web, Clip perlu membantu menyimpan URL dan konteks yang dipilih pengguna. Jika terjemahan membantu pemahaman, sumber asli harus tetap tersedia untuk perbandingan dan koreksi.
Ini adalah arah produk, bukan pengumuman bahwa Telli.sh sudah mengintegrasikan GPT-Live-1 atau Gemini 3.5 Live Translate. Fitur suara mendatang perlu menunjukkan manfaat nyata lintas bahasa, menghasilkan catatan yang dapat dipercaya, dan memberi kendali jelas atas apa yang disimpan. Kemajuan model harus membuat ruang kerja lebih berguna tanpa menggantungkan pengetahuan pribadi pada satu model.
Semakin mudah berbicara lintas bahasa, semakin kami ingin membantu agar nilai percakapan itu bertahan. Mulailah dari satu rapat yang perlu diingat, satu ide untuk dibagikan, atau satu sumber yang akan dibutuhkan lagi.