🎙️ Modelos Whisper
| Modelo | VRAM | Velocidad | Precisión | Recomendado |
|---|---|---|---|---|
| tiny | ~1 GB | ⚡⚡⚡⚡ | ★★ | No |
| base | ~1 GB | ⚡⚡⚡ | ★★★ | No |
| small | ~2 GB | ⚡⚡ | ★★★★ | Demo rápida |
| medium | ~5 GB | ⚡ | ★★★★ | Buen equilibrio |
| large-v3 | ~10 GB | ★★★★★ | ✅ RTX 5090 |
💾 Dataset ZFS
| Dataset | Contenido |
|---|---|
| whisper | Modelos Whisper (checkpoints) |
🐍 Ejemplo en Python
python
import whisper
# Charger le modèle (téléchargé si absent)
model = whisper.load_model('large-v3')
# Transcrire un fichier audio
result = model.transcribe(
'enregistrement.mp3',
language='fr',
verbose=True
)
print(result['text'])
# Avec timestamps
for segment in result['segments']:
print(f"[{segment['start']:.1f}s] {segment['text']}") 🎯 Competencias en desarrollo
- Instalación de Whisper con aceleración GPU (CUDA)
- Transcripción de audio/vídeo en francés y multilingüe
- Selección del modelo según restricciones de VRAM/velocidad
- Integración en un pipeline n8n (disparador de audio → STT → LLM)
- IA multimodal: audio → texto → LLM → respuesta