🎙️ Modelos Whisper
ModeloVRAMVelocidadPrecisiónRecomendado
tiny~1 GB⚡⚡⚡⚡★★No
base~1 GB⚡⚡⚡★★★No
small~2 GB⚡⚡★★★★Demo rápida
medium~5 GB⚡★★★★Buen equilibrio
large-v3~10 GB★★★★★✅ RTX 5090
💾 Dataset ZFS
DatasetContenido
whisperModelos Whisper (checkpoints)
🐍 Ejemplo en Python
python
import whisper

# Charger le modèle (téléchargé si absent)
model = whisper.load_model('large-v3')

# Transcrire un fichier audio
result = model.transcribe(
    'enregistrement.mp3',
    language='fr',
    verbose=True
)

print(result['text'])

# Avec timestamps
for segment in result['segments']:
    print(f"[{segment['start']:.1f}s] {segment['text']}")
🎯 Competencias en desarrollo
  • Instalación de Whisper con aceleración GPU (CUDA)
  • Transcripción de audio/vídeo en francés y multilingüe
  • Selección del modelo según restricciones de VRAM/velocidad
  • Integración en un pipeline n8n (disparador de audio → STT → LLM)
  • IA multimodal: audio → texto → LLM → respuesta

Páginas relacionadas

Referencias y fuentes

CategoríaRecursoURL
Documentación oficialOpenAI Whispergithub.com/openai/whisper
ModelosWhisper — modèles multilingues (Hugging Face)huggingface.co/openai
EstadoTranscription audio/vidéo — validé, portage planifié sur VM210—
LicenciaWhisper — MITgithub.com/openai/whisper — LICENSE
Contenido de esta páginaCompartido bajo CC BY-SA 4.0creativecommons.org/licenses/by-sa/4.0