Meta meluncurkan model persepsi audio real-time pertamanya yang diberi nama Muse Voice Transcribe melalui Meta Superintelligence Lab atau MSI. Model kecerdasan buatan terbaru ini dirancang untuk mendeteksi serta membedakan transkripsi dari banyak pembicara secara serentak dalam berbagai bahasa secara langsung.
Kemampuan Transkripsi dan Ragam Bahasa
Sistem kecerdasan buatan ini diklaim mampu menangani dikte serta transkripsi untuk lebih dari 20 pembicara sekaligus secara mulus. Berdasarkan keterangan resmi perusahaan, pemodelan ini telah dilatih mencakup lebih dari 70 bahasa dengan 25 bahasa di antaranya telah divalidasi pada saat peluncuran perdana.
Teknologi tersebut juga sanggup menangani pencampuran bahasa atau code-switching di tengah kalimat secara akurat. Sistem ini tetap berfungsi optimal meskipun dihadapkan pada kondisi rekaman audio dunia nyata yang kompleks dan berlangsung dalam durasi sesi mencapai satu jam penuh.
CEO Meta Mark Zuckerberg menyampaikan bahwa teknologi ini menjadi yang terdepan dalam bidang pengubahan suara ke teks secara langsung atau streaming speech-to-text. Model tersebut mampu melakukan pemisahan pembicara atau speaker diarization serta penentuan titik akhir secara mandiri dalam satu model tunggal.
Baca Juga: Apple Maps Ubah Nama Danau Ontario Jadi Lake America
Mekanisme Kerja dan Integrasi Layanan
Model ini diklaim dapat menentukan sendiri waktu yang tepat untuk mendengarkan percakapan. Sistem menerapkan jeda adaptif untuk memprediksi setiap token demi meningkatkan tingkat akurasi dengan cara menunggu sedikit lebih lama pada kata-kata sulit serta memproses kata mudah dengan cepat.
Peluncuran teknologi baru dari Meta ini hadir kurang dari sepekan setelah Google memperkenalkan model audio miliknya sendiri yakni Google Gemini 3.5 Transcribe yang membawa kapabilitas serupa. Walau Google mengintegrasikan model audionya langsung ke sistem Android serta Chrome, Meta belum merinci rencana penerapan Muse Voice Transcribe pada seluruh layanan utamanya.
Kendati demikian, para pengguna saat ini sudah dapat menjajal kemampuan model tersebut melalui aplikasi Meta AI untuk komputer Mac. Aplikasi Mac tersebut memiliki kapabilitas untuk mendukung berbagai fitur berbasis suara pada aplikasi lain sehingga Muse Voice Transcribe secara otomatis akan menggerakkan fitur dikte pada layanan tersebut.
Ketersediaan Pengembang dan Harga
Bagi para pengembang perangkat lunak, model ini dapat diakses secara langsung di dalam ekosistem Muse Code serta melalui Meta Model API. Meta menetapkan tarif penggunaan layanan transkripsi ini sebesar tiga dolar Amerika Serikat untuk setiap seribu menit audio.
Baca Juga: Cara Mengubah Wallpaper Latar Belakang Obrolan di Pesan iPhone
Selain itu, pihak pengelolanya juga menyediakan versi demo dari Muse Transcribe yang dapat diakses melalui blog penelitian resmi perusahaan. Peluncuran model audio ini melengkapi rangkaian inovasi yang dikeluarkan oleh Meta Superintelligence Lab dalam beberapa pekan terakhir.
Sebelumnya, divisi tersebut juga telah memperkenalkan agen pengodean khusus pertama, model open-weight, serta aplikasi Meta AI untuk perangkat Mac. Berbagai produk baru ini menunjukkan peningkatan intensitas pengembangan model dan perangkat kecerdasan buatan oleh perusahaan tersebut.






