TSMlBUA7TprpTUG5BSGlTfA7GA==

Gemini 3.5 Transcribe Resmi Dirilis Google, Bisa Ubah Suara Jadi Teks Lebih Cepat

 

Gemini 3.5 Transcribe Resmi Dirilis Google, Bisa Ubah Suara Jadi Teks Lebih Cepat
Sumber Gambar : Kompas Tekno

Jogjaterkini.id - Google kembali memperluas kemampuan teknologi kecerdasan buatan melalui Gemini 3.5 Transcribe. Model AI terbaru ini dirancang untuk mengubah percakapan suara menjadi teks dengan proses yang lebih cepat sekaligus menghasilkan transkripsi yang lebih rapi.

Kehadiran Gemini 3.5 Transcribe membawa pendekatan yang berbeda dari teknologi speech-to-text konvensional. Model ini tidak hanya bertugas mengenali dan menuliskan ucapan, tetapi juga diklaim mampu memahami konteks pembicaraan sehingga hasil akhirnya lebih mudah dibaca.

Gemini 3.5 Transcribe Diklaim Lebih Cepat

Salah satu keunggulan yang ditawarkan Gemini 3.5 Transcribe adalah peningkatan kecepatan pemrosesan. Google menyebut model ini dapat menghasilkan teks akhir sekitar 70 persen lebih cepat dibandingkan model speech-to-text sebelumnya, Chirp 3.

Peningkatan tersebut membuat teknologi transkripsi berbasis AI ini berpotensi digunakan untuk berbagai kebutuhan yang membutuhkan pengubahan suara menjadi teks dalam waktu singkat.

Selain kecepatan, Google juga meningkatkan tingkat akurasi Gemini 3.5 Transcribe. Dalam pengujian terhadap percakapan langsung atau live speech, model tersebut mencatat tingkat kesalahan sebesar 5,5 persen.

Angka tersebut lebih rendah dibandingkan Chirp 3 yang memiliki tingkat kesalahan 7,32 persen berdasarkan pengukuran Google.

Bukan Sekadar Menyalin Percakapan

Gemini 3.5 Transcribe dirancang untuk memberikan hasil transkripsi yang lebih bersih. Model ini dapat menghilangkan sejumlah kata pengisi yang umum digunakan ketika seseorang berbicara, seperti "ehm" atau "eee".

Kemampuan tersebut membuat hasil transkripsi tidak sekadar menjadi salinan mentah dari percakapan. Teks yang dihasilkan dapat terlihat lebih rapi karena kata-kata yang tidak memiliki arti penting dalam konteks pembicaraan dapat disisihkan.

Model ini juga mampu menangani perubahan ucapan selama percakapan berlangsung. Ketika seseorang mengoreksi perkataannya, Gemini 3.5 Transcribe dapat melakukan penyuntingan secara langsung sehingga teks yang ditampilkan mengikuti koreksi tersebut.

Mendukung Istilah Teknis dan Jargon Khusus

Google turut membekali Gemini 3.5 Transcribe dengan dukungan terhadap kosakata khusus yang dapat ditentukan oleh pengguna.

Fitur ini berguna untuk kebutuhan transkripsi yang melibatkan istilah teknis, nama khusus, atau jargon tertentu. Dengan adanya kosakata yang ditentukan pengguna, model dapat menyesuaikan proses transkripsi dengan istilah yang digunakan dalam percakapan.

Kemampuan tersebut berpotensi membantu pengguna yang bekerja dengan materi audio dalam bidang yang memiliki banyak istilah khusus.

Bisa Mengenali Hingga Tiga Pembicara

Dari sisi dukungan bahasa, Gemini 3.5 Transcribe dapat digunakan untuk 85 bahasa. Model ini juga mampu mengenali percakapan yang melibatkan hingga tiga pembicara dalam satu rekaman audio.

Kemampuan tersebut membuatnya tidak hanya ditujukan untuk input suara dari satu orang. Percakapan dengan beberapa pembicara juga dapat diproses menggunakan model baru tersebut.

Gemini 3.5 Transcribe Sudah Digunakan di Gboard

Teknologi Gemini 3.5 Transcribe saat ini telah digunakan pada fitur Rambler di aplikasi keyboard Gboard. Namun, penggunaan fitur tersebut masih terbatas pada perangkat Pixel 11.

Google berencana memperluas ketersediaan Rambler ke lebih banyak perangkat yang memiliki kemampuan Gemini pada akhir 2026.

Selain Gboard, pengguna aplikasi Gemini di macOS juga mulai memperoleh manfaat dari model tersebut untuk kebutuhan input suara.

Pengembang Bisa Mengakses Gemini 3.5 Transcribe

Google tidak hanya menyediakan Gemini 3.5 Transcribe untuk produk buatannya. Model ini juga mulai dibuka untuk pengembang melalui sejumlah layanan.

Gemini 3.5 Transcribe telah tersedia di Antigravity dan AI Studio. Pengembang juga dapat memanfaatkan Gemini API untuk memasukkan kemampuan voice-to-text berbasis AI ke dalam aplikasi yang mereka buat.

Dengan akses melalui API, kemampuan transkripsi tersebut dapat digunakan dalam berbagai produk atau layanan yang membutuhkan konversi suara menjadi teks.

Google Siapkan Integrasi Gemini 3.5 Transcribe di Chrome

Google juga memiliki rencana untuk membawa kemampuan Gemini 3.5 Transcribe ke peramban Chrome.

Jika integrasi tersebut terealisasi, pengguna nantinya dapat memanfaatkan input suara untuk mengisi berbagai kolom teks di situs web. Pengguna dapat menggunakannya untuk kebutuhan seperti menulis e-mail, memberikan komentar, maupun memasukkan perintah kepada chatbot AI.

Langkah ini menunjukkan bahwa Google tidak hanya mengembangkan teknologi transkripsi untuk aplikasi tertentu, tetapi juga berupaya memperluas penggunaannya ke berbagai aktivitas di internet.

Gemini 3.5 Transcribe Perluas Fungsi AI untuk Input Suara

Gemini 3.5 Transcribe membawa kemampuan speech-to-text ke tahap yang lebih luas. Selain mengejar kecepatan dan akurasi, model ini dirancang untuk menghasilkan teks yang lebih rapi dengan memahami percakapan dan mengurangi kata-kata pengisi.

Dukungan terhadap 85 bahasa, pengenalan hingga tiga pembicara, kosakata khusus, serta kemampuan mengoreksi transkripsi secara langsung menjadi sejumlah fitur yang ditawarkan Google.

Dengan mulai hadirnya teknologi ini di Gboard, aplikasi Gemini di macOS, serta layanan untuk pengembang, Gemini 3.5 Transcribe berpotensi menjadi salah satu teknologi yang memperluas penggunaan input suara berbasis AI di berbagai perangkat dan aplikasi.

Ketik kata kunci lalu Enter

close