Meta Superintelligence Labs වලින් එයාලගේ පළවෙනිම real-time audio perception model එක වෙන Muse Voice Transcribe දැන් එළිදක්වලා තියෙනවා. ඉතින් මේක ඇත්තටම Audio තාක්ෂණයේ ලොකු පෙරළියක් වෙයි කියලා ගොඩක් අය කියනවා.
මේ අලුත් Muse Voice Transcribe එකෙන් අපිට real-time streaming ASR, එකම වෙලාවෙ කතා කරන 20+ speakers ලා වෙන් කරලා අඳුරගන්න පුළුවන් diarization, සහ endpointing වගේ සුපිරි Features ගොඩක් දෙනවා. ඒ වගේම මේක භාෂා ගණනාවකට Support කරන multilingual Model එකක් වෙනවා වගේම, කතා කරන ගමන් භාෂාව මාරු කරද්දී seamless code-switching හරහා ඒක ලේසියෙන්ම තේරුම් ගන්නත් මේකට පුළුවන්. තවත් විශේෂ දෙයක් තමයි language, keyword, සහ context biasing පාවිච්චි කරලා මේකේ Accuracy එක ගොඩක් දුරට වැඩි කරලා තියෙන එක.


දැනටමත් @ArtificialAnlys streaming speech-to-text ලිස්ට් එකේ වගේම public diarization benchmarks වල පළවෙනි තැනට එන්නත් මේ Model එක සමත් වෙලා තියෙනවා. ඉතින් මේ අලුත් Audio තාක්ෂණය ගැන ඔයා මොකද හිතන්නේ? පහළින් කමෙන්ට් කරන්න.
Shalinda Jayasinghe
