🎙️ Модели Whisper
МодельVRAMСкоростьТочностьРекомендуется
tiny~1 ГБ⚡⚡⚡⚡★★Нет
base~1 ГБ⚡⚡⚡★★★Нет
small~2 ГБ⚡⚡★★★★Быстрая демонстрация
medium~5 ГБ⚡★★★★Хороший компромисс
large-v3~10 ГБ★★★★★✅ RTX 5090
💾 Датасет ZFS
ДатасетСодержимое
whisperМодели Whisper (чекпоинты)
🐍 Пример на Python
python
import whisper

# Charger le modèle (téléchargé si absent)
model = whisper.load_model('large-v3')

# Transcrire un fichier audio
result = model.transcribe(
    'enregistrement.mp3',
    language='fr',
    verbose=True
)

print(result['text'])

# Avec timestamps
for segment in result['segments']:
    print(f"[{segment['start']:.1f}s] {segment['text']}")
🎯 Компетенции в процессе освоения
  • Установка Whisper с ускорением на GPU (CUDA)
  • Транскрипция аудио/видео на французском и других языках
  • Выбор модели с учётом ограничений VRAM/скорости
  • Интеграция в пайплайн n8n (триггер по аудио → STT → LLM)
  • Мультимодальный ИИ: аудио → текст → LLM → ответ

Связанные страницы

Ссылки и источники

КатегорияРесурсURL
Официальная документацияOpenAI Whispergithub.com/openai/whisper
МоделиWhisper — modèles multilingues (Hugging Face)huggingface.co/openai
СтатусTranscription audio/vidéo — validé, portage planifié sur VM210—
ЛицензияWhisper — MITgithub.com/openai/whisper — LICENSE
Содержимое этой страницыПубликуется под CC BY-SA 4.0creativecommons.org/licenses/by-sa/4.0