Польский язык и промпты: разоблачение мифа от Microsoft
Недавно в СМИ распространили новость, что «польский язык лучше всего подходит для промптования» (Dzik тоже писал, что чат-бот лучше «думает» по-польски, чем по-английски, хотя тут, конечно, есть свои «но» и «если»).
Этот вывод сделали после проверки с помощью бенчмарка ONERULER, как большие языковые модели справляются с анализом очень длинных текстов. Однако PAP поговорил с одной из авторов работы, Маженой Карпиньской из Microsoft, и всё оказалось не так однозначно и просто.
Пояснения от автора
1️⃣ Во-первых, по словам пани Мажены, авторы вовсе не тестировали, насколько польский подходит для написания промптов. «Мы создали инструмент для диагностики языковых моделей, проверяющий, насколько хорошо они способны извлекать информацию из очень длинных текстов», — сказала она.
Так, заданий было два. Первое состояло в том, что модель должна была найти в книге на том или ином языке определённое предложение с информацией. Как CTRL+F.
И второе задание заключалось в составлении списка самых популярных слов в том или ином языке на основании книги. И тут модели «сыпались» на условии, что ответа может и не быть в искомом тексте. В этом задании точность значительно падала.
2️⃣ Во-вторых, для разных языков использовались разные книги, на которые уже истекли авторские права за сроком давности. Например, для польского взяли третий том «Noce i dnie», для испанского — «Дон Кихота», для английского — «Маленьких женщин». То есть, это были книги из разных исторических периодов. Возможно, поэтому польские «Ночи и дни» по какой-то причине оказались для моделей легче для поиска, чем «Маленькие женщины».
По мнению собеседницы PAP, то, что ни одна из моделей не достигла 100% точности в таком простом задании, должно стать предупреждением для всех пользователей языковых моделей.
По её словам, мы не должны слепо доверять чат-ботам. Иногда они «невероятно хороши, а через мгновение — совершают огромные ошибки».