Польский язык оказался лучшим для ИИ в тесте ONERULER
Исследователи из Мэриленда и Microsoft создали бенчмарк ONERULER, который проверяет, как большие языковые модели справляются с анализом очень длинных текстов — таких, которые содержат даже 128 тысяч токенов.
Как пишут Notes from Poland, в исследование включили 26 естественных языков — от английского и китайского до финского, арабского и польского.
Модели должны были выполнять серию задач: искать информацию в гигантских документах, резюмировать «прочитанное», соединять данные из разных фрагментов контекста. И по итогам польский занял первое место, а английский — лишь шестое.
Оказалось, то, что заставляет плакать изучающих польский, нравится LLM (да, все эти склонения, исключения, чередование звуков и т.д.). Модели это кажется структурированным и логичным.
С одной стороны, звучит хорошо для польских чат-ботов. С другой, как справедливо замечает mamstartup.pl, будет правильнее сказать, что «польский язык — один из языков с высоким приоритетом для ИИ, особенно в контексте локализации (на Польшу)», а не просто — «польский лучший язык для LLM».
«Да, это правда: польский язык имеет потенциал структурного преимущества благодаря своей морфологии и способности кодировать значения внутри слов, — отмечают авторы. — Но это преимущество должно быть подкреплено отличными инструментами: токенизацией, лемматизацией, сегментацией морфем, токенизаторами типа APT для польского. Без этого потенциальное преимущество остаётся неиспользованным».