Звуковой суверенитет: зачем Сбер выложил в опенсорс свои лучшие аудио-модели ✅
⚡️ чт · 16 июля · 09:09 · #plugoShots 153 – аудио-опенсорсный
Сбер открыл речевые модели бесплатно. Трезво – о том, что это значит.
Сбер выложил в открытый доступ под лицензией MIT два решения: семейство моделей распознавания речи GigaAM Multilingual и мультимодальную языковую модель GigaChat Audio.
Без оплаты, для всех разработчиков. Это реально интересный ход — разбираю без лишнего пиара, но и без снобизма.
1 | Что за модели и чем они примечательны
GigaAM Multilingual при всего 240 млн параметров в тестах обходит Whisper Large v3 от OpenAI по точности распознавания языков СНГ. Это не мелочь – компактная российская модель уделывает флагман OpenAI на родном языковом поле.
GigaChat Audio идёт ещё дальше – работает со звуком напрямую, без промежуточного перевода в текст. Определяет эмоции и интонации с точностью 80%, опережая китайские тяжеловесы Qwen3-Omni-30B и Kimi-Audio.
Обе модели Сбера – уже опубликованы на Hugging Face и GitHub.
2 | Как это соотносится с мировыми аналогами
Whisper от OpenAI и Google Speech-to-Text – весьма зрелые решения с огромными экосистемами. Но у них есть слабое место: русский язык, диалекты СНГ, специфическая терминология. Именно здесь локальная модель объективно выигрывает.
Плюс – важный момент для бизнеса: данные не уходят за рубеж. В текущих реалиях это не просто удобство, а требование регулятора для целого ряда отраслей.
3 | Прикладные области применения
Вот прикладные направления применения "из коробки", которые сразу приходят в голову: диаризация (разделение записи по голосам спикеров), распознавание контекста до 3 часов слитного аудио, авто-саммари звонков с таймкодами.
- Контакт-центры и колл-трекинг – самое массовое применение
- Протоколы совещаний и транскрибация – уже сейчас востребовано повсюду
- Медицинские записи
- Юридические протоколы
- Образование
В общем, везде, где нужна высокая точность. А еще – сервисы для людей с нарушениями речи – социально важное направление, которое коммерческие игроки обычно игнорируют.
4 | Эх, нам бы такое на ИИ-хакатонах...
Когда несколько лет назад мы с командой проводили ИИ-хакатоны по всей стране – в десятках городов, с сотнями команд – одним из главных барьеров для участников был именно доступ к качественным базовым моделям.
Ребята тратили половину времени не на решение задачи, а на то, чтобы подключить хоть что-то рабочее (в том числе для распознавания речи). Мучились с закрытыми зарубежными API, собирали костыли из сырых моделей, путавших акценты и контекст.
Появись такие (отечественные, открытые) аудио-движки тогда – уверен, мы бы увидели сотни готовых b2b-продуктов уже на стадии демо-дней, собранные за 48 хакатонных часов.
Мои выводы
При всей критике экосистемного монополизма, о котором часто слышим в последнее время – Сбер безоговорочные молодцы. Выкатить технологии такого класса в опенсорс под MIT – это сильный, зрелый шаг для развития всей ИТ-индустрии.
Что наглядно доказывает:
Сбер умеет в глубокий, фундаментальный ИИ-бэкенд мирового уровня 🤝
⚡️ чт · 16 июля · 09:09 · #plugoShots 153 – аудио-опенсорсный
@plugoNews — технологические (и не только) инсайты по будням в 09:09
Вести.net о генеративном ИИ Сбера
Этот видеосюжет наглядно демонстрирует общую стратегию Сбера по выводу экспериментальных генеративных ИИ-моделей в открытый доступ.
@plugoNews — технологические (и не только) инсайты по будням в 09:09