Disponibile su Google Play Entra nel Talent Radar
Newsletter settimanale

TechCompenso per Te

Ogni settimana annunci remote-friendly, sia ibridi che full-remote, e consigli di carriera per muoverti meglio nel mercato tech e digital in Italia.

C

Machine Learning Engineer, Speech - Joint Audio-Video Modeling

🏢 Cantina Labs

Full-Remote

📝 Descrizione

Join Cantina Labs to build state-of-the-art speech and audio generation systems for joint audio-video modeling. Own audio representations (audio VAEs, neural codecs, vocoders), generative backbones (diffusion/flow-matching transformers), conditioning/alignment for voice cloning and multi-speaker scenarios, and adjacent tasks (controllable TTS, voice conversion). Lead model/data/eval cycles, design experiments and listening tests, drive inference efficiency (distillation, quantization), productionize training→evaluation→inference pipelines, and partner on GPU scaling and safety/consent guardrails. Requires strong large-scale audio model experience, distributed training, PyTorch and performance/CUDA skills, and production ML engineering.

🔎 Informazioni

💼

Livello di esperienza

Senior

🖥️

Modalità di lavoro

Full-Remote

💰

Retribuzione annuale

200.000€ - 220.000€

🔹 Audio VAEs 🔹 Neural codecs 🔹 Vocoder 🔹 Diffusion 🔹 Flow-matching 🔹 Transformers 🔹 PyTorch 🔹 CUDA 🔹 Triton 🔹 C++ 🔹 FSDP 🔹 DeepSpeed 🔹 TTS 🔹 Voice cloning 🔹 Multimodal 🔹 Video generation 🔹 Distributed training 🔹 Quantization 🔹 Distillation