‹ kembali ke daftar#5 / 26
TECH 30/SEP/2026

Google Rilis Gemini 3.8 Flash TTS: 2.000+ Suara Sintetis dengan Watermark SynthID

Google meluncurkan Gemini 3.8 Flash TTS dan Flash-Lite TTS: 2.000+ profil suara, 100+ bahasa, kloning 30 detik, plus watermark SynthID dan C2PA.

Google baru aja nge-rilis dua model text-to-speech (TTS) anyar lewat keluarga Gemini: Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS. Ini bukan update receh. Google beneran ngganti katalog suara lama mereka yang cuma berisi "fixed catalogues of 30 legacy voices" jadi sistem sintesis suara yang jauh lebih luas dan fleksibel. Buat lo yang main di produk audio, voice agent, atau dubbing, ini berita yang layak banget disimak sampai detail.

Menurut laporan AI News, rilis ganda ini sengaja mecah tugas sintesis suara jadi dua jalur: satu buat arah kreatif, satu lagi buat infrastruktur yang dikelola dari sisi biaya. Jadi lo bisa milih model yang paling pas sama kebutuhan produksi dan kantong.

Ilustrasi model Gemini 3.8 Flash TTS beserta watermark SynthID (kredit: artificialintelligence-news.com)
Ilustrasi model Gemini 3.8 Flash TTS beserta watermark SynthID (kredit: artificialintelligence-news.com)

Beda Flash TTS vs Flash-Lite TTS

Kedua model sebenernya punya "job desk" yang beda. Gemini 3.8 Flash TTS diarahkan buat interactive entertainment, pengembangan game, dan narasi panjang — tempat tim studio butuh desain suara lewat prompt teks. Sementara Gemini 3.8 Flash-Lite TTS fokus ke dubbing media otomatis, agen percakapan buat customer, dan pipeline terjemahan bervolume tinggi.

Keduanya ngeganti generasi audio Google sebelumnya yang sempat ngenalin 3.5 Live Translate, 3.5 Transcribe, 3.8 Live, dan 3.8 Live Extended Thinking.

Yang bikin beda: 2.000+ suara dan 100+ bahasa

Ini bagian yang paling gue suka. Developer sekarang bisa akses direktori berisi lebih dari 2.000 profil suara siap pakai, mencakup variasi regional kayak Quebec French, Scots English, sampai Mexican Spanish, di lebih dari 100 bahasa. Ada juga modul voice remixing yang bakal datang (forthcoming), buat nge-tweak timbre, pitch, pace, dan kontur aksen lewat perintah teks langsung.

Soal kualitas, ada bukti dari pihak ketiga. Di Hume AI Voice Design Benchmark, Gemini 3.8 Flash TTS nyetak skor keseluruhan 71.4, plus nilai 60.8 di kategori accent modelling. Di Hume AI Overall Quality Index, Flash TTS nangkring di posisi pertama dan Flash-Lite TTS di posisi kedua — ngalahin baseline Gemini 3.1 Flash TTS yang jadi patokan sebelumnya.

Uji double-blind lewat Voice Arena juga nunjukin preferensi buat bahasa regional: Jepang, Brazilian Portuguese, Vietnam, Modern Standard Arabic, Mexican Spanish, dan Hindi.

Multi-speaker, marker non-verbal, dan kloning suara

Satu hal yang keren: satu skrip bisa ngarahin percakapan dua speaker, dengan turn-taking alami dan pemisahan suara yang tetap terjaga di dialog panjang. Kualitas audio dan timbre juga stabil di file berjam-jam, jadi degradasi suara berkurang pas lo bikin audiobook atau podcast berseri.

Penulis juga bisa nyelipin marker non-verbal langsung di teks — kayak <laughs>, <sigh>, atau <gasp>, plus interjeksi verbal |mhm| dan |yeah| buat ngatur tempo percakapan.

Buat kloning suara, Google ngebesarin pengamanan. Bikin profil suara baru wajib pakai rekaman referensi 30 detik plus track persetujuan verbal yang diucapin pemilik suara asli. Google validasi kecocokan akustik antara dua track itu sebelum naruh custom profile. Hasil audionya lalu disisipi watermark SynthID tak terdengar dan metadata provenance C2PA di waveform, jadi tool deteksi bisa ngenalin mana audio sintetis.

Harga dan ketersediaan

Ini poin penting: artikel sumbernya nggak nyebut angka harga sama sekali. Jadi gue nggak mau ngarang di sini. Yang jelas, deployment udah mulai jalan. Developer bisa akses Flash TTS dan Flash-Lite TTS lewat Google AI Studio dan Gemini API standar, lalu nyambung ke framework developer kayak Agora, LiveKit, Pipecat, dan Vercel.

Integrasi komersial awalnya mencakup Figma, HeyGen, Linguana, Wondercraft, 99.co, dan Ollang — buat terjemahan media regional dan otomasi layanan pelanggan. Buat end user, Flash TTS masuk langsung ke Gemini Notebook, sedangkan Google Vids pakai Flash-Lite TTS. Pelanggan Gemini Enterprise baru bakal dapet akses API administratif di "upcoming deployment wave" yang belum disebut tanggal pastinya.

Dampak buat developer dan produk

Buat gue, ini langkah besar buat tiga hal. Pertama, voice agent. Dengan 2.000+ profil suara dan lebih dari 100 bahasa, lo bisa bikin agen suara yang bener-bener lokal, bukan asal "English dengan aksen aneh". Kedua, dubbing. Pipeline terjemahan bervolume tinggi plus modul remixing aksen bikin lokalisasi konten jauh lebih murah dan cepat. Ketiga, aksesibilitas. Narasi yang stabil di file berjam-jam itu emas buat audiobook, konten edukasi, dan alat bantu buat teman-teman difabel netra.

Bandingin sama TTS jadul yang suaranya datar dan kaku, lompatannya kerasa banget. Dulu lo cuma bisa milih dari 30 voice tetap dengan nuansa yang itu-itu aja. Sekarang lo bisa ngerancang profil suara lewat teks, nge-kloning suara secara aman, dan ngatur emosi pakai marker sederhana.

Opini gue

Gue jujur aja nih. Yang paling gue hargain dari rilis ini bukan cuma soal jumlah suaranya, tapi soal etika kloningnya. Syarat 30 detik rekaman plus persetujuan verbal itu rem sederhana tapi penting, di tengah maraknya suara palsu buat scam dan penipuan. Ditambah watermark SynthID dan metadata C2PA, Google kelihatan serius soal provenance. Buat lo yang bikin produk publik, ini bukan fitur pelengkap — ini wajib.

Tapi gue juga nggak mau lo kalap. Tanpa harga yang jelas dan tanpa tanggal pasti buat Gemini Enterprise, ceritanya masih setengah jalan. Buat studio besar sih ini langsung kepake; buat developer indie yang mepet budget, kita sabar tunggu angka resminya dulu. Gue pribadi lebih penasaran sama modul voice remixing yang katanya bakal datang, karena di situ kreativitas beneran diuji.

Yang pasti: era "suara robot datar" udah mau tamat. Dan lo yang ngerti ini lebih awal punya keuntungan tersendiri.

Sumber

BACA JUGA