Bielik.AI выпустил ИИ-модель «Sójka» для модерации контента на польском
🦆 Вышла «Sójka» — ИИ-модель для модерирования контента в сети (она распознаёт польские маты и контент 18+)
Bielik.AI представил первую версию Bielik Guard или «Sójka». Это ИИ модель, разработанная для выявления токсичного контента в цифровой коммуникации.
Как пишет ITWiz, это один из первых в Польше инструментов типа guardrails, работающий в реальном времени и готовый к интеграции с приложениями, социальными сервисами или чат-ботами.
Проект «Sójka» возник как «ответ на нарастающую проблему хейта, вульгаризмов или словесного абьюза в интернете» благодаря работе команды из сообщества Speak Leash, а также привлечению сообщества.
Более 1500 человек заполнили 65 тыс. анкет, помогая команде в подготовке обучающих данных и указывая контент, который не должен публиковаться.
Кроме того, «Сойку» строили на данных и аннотациях, учитывающих семантические и грамматические реалии польского. Благодаря этому модель лучше понимает локальный языковой и культурный контекст.
Издание отмечает, что большим преимуществом модели является «приспособленность к польскому культурному контексту и языку» (то есть, она поймёт все вариации слова из трёх и пяти букв).
Кроме того, «Sójka» — это регрессионная модель, которая позволяет уловить не только однозначно вредный контент, но также и тот, что «находится на грани», где обычные алгоритмы часто дают сбой.
Модель проверяет контент с точки зрения пяти областей: «языка ненависти», вульгаризмов, контента 18+, криминальных инструкций и аутоагрессивных поведений (самоповреждения). Именно эти категории составляют ядро проекта и позволяют отличать то, что нейтрально, от того, что реально угрожает пользователям.
«Это экспериментальный проект с большим потенциалом. Его результаты могут найти применение не только в секторе новых технологий, но также в образовании, СМИ или публичной администрации. Общая цель одна — построение более безопасной цифровой среды, в которой свобода слова не означает разрешения на токсичность», — заключают авторы.
Что дальше?
Первая версия «Сойки» уже достигает высокой эффективности на тестовых данных. Но, конечно, это только начало работы.
Создатели модели хотят, чтобы она «выявляла по крайней мере 9 из 10 токсичных контентов, одновременно ограничивая количество "ложных срабатываний", то есть ситуаций, когда нейтральные высказывания несправедливо классифицируют как опасные».
Дальнейшие работы над «Сойкой» будут вестись параллельно в трёх направлениях:
- доработка руководящих принципов и добавление новых категорий (например, дезинформации) при поддержке экспертов в области этики;
- развитие инструментов аннотации и повышение качества данных;
- эксперименты с обучением моделей: повышение точности, добавление поддержки других языков, в том числе английского, тесты влияния архитектуры модели на эффективность.
Потестировать «Сойку» можно вот тут
🐽 Как вы думаете, что лучше: ограничения ради всеобщего блага или интернет как «Дикий Запад», где все пишут всё, что в голову взбредёт?