Eric Bezzam PRO
AI & ML interests
speech, audio, imaging
Recent Activity
new activity about 8 hours ago
owensong/Inflect-Micro-v2:Add results from Hugging Face's Open TTS Leaderboard new activity about 18 hours ago
hf-audio/open-asr-leaderboard-results:Add meta/muse-voice-transcribe results new activity about 18 hours ago
hf-audio/multilingual_evals:Add meta/muse-voice-transcribe resultsOrganizations
Neural codecs
Multimodel audio
Text-to-speech datasets
DiffuserCam Mirflickr
Models for the paper "A modular and robust physics-based approach for lensless image reconstruction"
VibeVoice
Omnilingual ASR (1,600+ Languages)
https://ai.meta.com/blog/omnilingual-asr-advancing-automatic-speech-recognition/
- Paused241
Omnilingual ASR Media Transcription
🌍241Transcribe audio/video files into text instantly
-
facebook/omnilingual-asr-corpus
Viewer • Updated • 548k • 5.21k • 210 -
facebook/omniASR-CTC-300M
Automatic Speech Recognition • Updated • 15 -
facebook/omniASR-CTC-1B
Automatic Speech Recognition • Updated • 10
Speech recognition datasets
DigiCam (CelebA)
Models for DigiCam trained on the CelebA 26K dataset.
TTS eval
VibeVoice
Neural codecs
Omnilingual ASR (1,600+ Languages)
https://ai.meta.com/blog/omnilingual-asr-advancing-automatic-speech-recognition/
- Paused241
Omnilingual ASR Media Transcription
🌍241Transcribe audio/video files into text instantly
-
facebook/omnilingual-asr-corpus
Viewer • Updated • 548k • 5.21k • 210 -
facebook/omniASR-CTC-300M
Automatic Speech Recognition • Updated • 15 -
facebook/omniASR-CTC-1B
Automatic Speech Recognition • Updated • 10
Multimodel audio
Speech recognition datasets
Text-to-speech datasets
DigiCam (CelebA)
Models for DigiCam trained on the CelebA 26K dataset.
DiffuserCam Mirflickr
Models for the paper "A modular and robust physics-based approach for lensless image reconstruction"