Apollo Restore заполнит пропуски в древнегреческих папирусах

Исследователи из Mistral AI, Австрийской академии наук и Северо-Восточного университета в Бостоне представили генеративную модель Apollo Restore. Инструмент создан для работы с древнегреческими текстами и способен восстанавливать пропуски в папирусах. О разработке рассказано в препринте на arXiv.org. Об этом рассказывает N + 1.

Модель умеет заполнять лакуны даже тогда, когда неизвестно, сколько именно знаков утрачено. Для папирусов это принципиально важно: в отличие от эпиграфических памятников, где длина пропуска часто подсказывает его объём, здесь такой ориентир обычно отсутствует. Заполнение пробелов в таких документах требует много времени, поэтому за примерно полтора века исследований лингвисты ввели в научный оборот лишь восемь процентов уцелевших папирусов. Порядка миллиона документов до сих пор не прочитаны целиком.

На территории Средиземноморья и Ближнего Востока обнаружено свыше миллиона папирусов. Основная часть текстов написана на древнегреческом в период с 300 года до нашей эры по 700 год нашей эры. До наших дней большинство дошло фрагментами с разным числом лакун; многие находятся в собраниях библиотек и музеев разных стран.

Apollo Restore обучили на грекоязычных материалах объёмом примерно 600 миллионов слов. В корпус вошли тексты от Античности до 1900 года, причём больше двух третей относилось к эпохе до 1453 года, иными словами, до того как пал Константинополь. Использовались документы, литературные произведения и около 156 тысяч надписей. В основе работы лежит принцип Fill-in-the-Middle: модель опирается на контекст до и после пропуска.

Проверка показала преимущество над моделями Ithaca и Cullhed. Если лакуна включает от одного до 10 знаков, точность Apollo Restore составила 80,6 процента для документов, 54,6 процента для литературных текстов и 61 процент для эпиграфических памятников. Это в 1,4–2,6 раза лучше, чем у других разработок. Для пропусков до 20 символов разрыв увеличивается до 1,6–3,5 раза.

К тестам привлекли 20 специалистов по филологии, эпиграфике и папирологии. Они вслепую сравнивали результаты разных языковых моделей, а также оценивали исправления, предложенные Apollo Restore для уже опубликованных текстов. Примерно в одном случае из шести эксперты выбрали вариант прочтения от модели, а не общепринятый опубликованный.

Годом ранее Google DeepMind представила модель Aeneas для латинских эпиграфических памятников. Она должна помогать лингвистам и историкам, которые изучают древние надписи.