🎙️ Модели Whisper
| Модель | VRAM | Скорость | Точность | Рекомендуется |
|---|---|---|---|---|
| tiny | ~1 ГБ | ⚡⚡⚡⚡ | ★★ | Нет |
| base | ~1 ГБ | ⚡⚡⚡ | ★★★ | Нет |
| small | ~2 ГБ | ⚡⚡ | ★★★★ | Быстрая демонстрация |
| medium | ~5 ГБ | ⚡ | ★★★★ | Хороший компромисс |
| large-v3 | ~10 ГБ | ★★★★★ | ✅ RTX 5090 |
💾 Датасет ZFS
| Датасет | Содержимое |
|---|---|
| whisper | Модели Whisper (чекпоинты) |
🐍 Пример на Python
python
import whisper
# Charger le modèle (téléchargé si absent)
model = whisper.load_model('large-v3')
# Transcrire un fichier audio
result = model.transcribe(
'enregistrement.mp3',
language='fr',
verbose=True
)
print(result['text'])
# Avec timestamps
for segment in result['segments']:
print(f"[{segment['start']:.1f}s] {segment['text']}") 🎯 Компетенции в процессе освоения
- Установка Whisper с ускорением на GPU (CUDA)
- Транскрипция аудио/видео на французском и других языках
- Выбор модели с учётом ограничений VRAM/скорости
- Интеграция в пайплайн n8n (триггер по аудио → STT → LLM)
- Мультимодальный ИИ: аудио → текст → LLM → ответ