plugoShots
July 16

Звуковой суверенитет: зачем Сбер выложил в опенсорс свои лучшие аудио-модели ✅

⚡️ чт · 16 июля · 09:09 · #plugoShots 153 – аудио-опенсорсный


Сбер открыл речевые модели бесплатно. Трезво – о том, что это значит.

Сбер выложил в открытый доступ под лицензией MIT два решения: семейство моделей распознавания речи GigaAM Multilingual и мультимодальную языковую модель GigaChat Audio.

Без оплаты, для всех разработчиков. Это реально интересный ход — разбираю без лишнего пиара, но и без снобизма.


1 | Что за модели и чем они примечательны

GigaAM Multilingual при всего 240 млн параметров в тестах обходит Whisper Large v3 от OpenAI по точности распознавания языков СНГ. Это не мелочь – компактная российская модель уделывает флагман OpenAI на родном языковом поле.

GigaChat Audio идёт ещё дальше – работает со звуком напрямую, без промежуточного перевода в текст. Определяет эмоции и интонации с точностью 80%, опережая китайские тяжеловесы Qwen3-Omni-30B и Kimi-Audio.

Обе модели Сбера – уже опубликованы на Hugging Face и GitHub.


2 | Как это соотносится с мировыми аналогами

Whisper от OpenAI и Google Speech-to-Text – весьма зрелые решения с огромными экосистемами. Но у них есть слабое место: русский язык, диалекты СНГ, специфическая терминология. Именно здесь локальная модель объективно выигрывает.

Плюс – важный момент для бизнеса: данные не уходят за рубеж. В текущих реалиях это не просто удобство, а требование регулятора для целого ряда отраслей.


3 | Прикладные области применения

Вот прикладные направления применения "из коробки", которые сразу приходят в голову: диаризация (разделение записи по голосам спикеров), распознавание контекста до 3 часов слитного аудио, авто-саммари звонков с таймкодами.

Ну и области применения:

  • Контакт-центры и колл-трекинг – самое массовое применение
  • Протоколы совещаний и транскрибация – уже сейчас востребовано повсюду
  • Медицинские записи
  • Юридические протоколы
  • Образование

В общем, везде, где нужна высокая точность. А еще – сервисы для людей с нарушениями речи – социально важное направление, которое коммерческие игроки обычно игнорируют.


4 | Эх, нам бы такое на ИИ-хакатонах...

Когда несколько лет назад мы с командой проводили ИИ-хакатоны по всей стране – в десятках городов, с сотнями команд – одним из главных барьеров для участников был именно доступ к качественным базовым моделям.

Ребята тратили половину времени не на решение задачи, а на то, чтобы подключить хоть что-то рабочее (в том числе для распознавания речи). Мучились с закрытыми зарубежными API, собирали костыли из сырых моделей, путавших акценты и контекст.

Появись такие (отечественные, открытые) аудио-движки тогда – уверен, мы бы увидели сотни готовых b2b-продуктов уже на стадии демо-дней, собранные за 48 хакатонных часов.


Мои выводы

При всей критике экосистемного монополизма, о котором часто слышим в последнее время – Сбер безоговорочные молодцы. Выкатить технологии такого класса в опенсорс под MIT – это сильный, зрелый шаг для развития всей ИТ-индустрии.

Что наглядно доказывает:
Сбер умеет в глубокий, фундаментальный ИИ-бэкенд мирового уровня 🤝


⚡️ чт · 16 июля · 09:09 · #plugoShots 153 – аудио-опенсорсный


@plugoNews — технологические (и не только) инсайты по будням в 09:09

Вести.net о генеративном ИИ Сбера

Этот видеосюжет наглядно демонстрирует общую стратегию Сбера по выводу экспериментальных генеративных ИИ-моделей в открытый доступ.

@plugoNews — технологические (и не только) инсайты по будням в 09:09

Sergey Plugotarenko