
Древние надписи часто выглядят как набор странных значков на камне или глине. За ними стоят целые культуры, которые исчезли, оставив после себя только обрывки. Линейное письмо А с Крита, этрусские тексты, знаки долины Инда — все это до сих пор сопротивляется полному прочтению. Без подсказок вроде розеттского камня или явных родственников среди живых языков работа превращается в долгую головоломку, где каждый новый фрагмент может как помочь, так и запутать.
В последние годы к процессу подключились нейросети. Они уже умеют восстанавливать утраченные участки текстов, искать закономерности в тысячах древних надписей, проверять гипотезы и даже оценивать возраст и происхождение находок. Разберемся, что уже умеют такие системы, а где они пока бессильны.
Почему древние письмена так плохо поддаются
Кажется, что достаточно найти табличку, перевести знаки — и проблема решена. На самом деле все гораздо сложнее. Подавляющее большинство расшифровок прошлого стали возможными потому, что у исследователей была хоть какая-то подсказка. Иногда находилась надпись сразу на двух языках, как в случае с розеттским камнем. Порой удавалось доказать, что неизвестный язык родственен уже хорошо знакомому. В некоторых случаях помогали имена царей, городов или богов, которые повторялись в разных источниках. Когда ничего подобного нет, ученым приходится буквально собирать картину по отдельным кусочкам.
Получается далеко не всегда. Так, линейное письмо А, которым пользовались жители минойского Крита, до сих пор не удается уверенно прочитать. До наших дней дошло слишком мало текстов — всего несколько тысяч знаков. Этрусский язык изучен лучше, но и там большая часть находок представляет собой короткие надгробные надписи или посвящения. Этого недостаточно, чтобы понять, как язык устроен целиком и что означают многие слова.

Даже если исследователи уже знают, как произносился тот или иной знак, это еще не означает, что они понимают смысл текста. Представьте книгу, написанную знакомым алфавитом, но на совершенно неизвестном языке. Буквы можно прочитать вслух, а вот понять содержание не получится. Примерно с такой же проблемой сталкиваются специалисты по древним письменностям.
Работу осложняет и то, что сами находки редко доходят до нас в идеальном состоянии. Каменные плиты стираются за тысячи лет, папирусы обугливаются или рассыпаются, глиняные таблички трескаются. Иногда от целой строки остается всего несколько знаков, и исследователю приходится сначала пытаться восстановить недостающие фрагменты, а уже потом разбираться, что именно было написано.
Здесь нейросети оказались особенно полезны. Они могут за считаные минуты сравнить тысячи известных надписей, найти похожие сочетания знаков, предложить наиболее вероятное восстановление утраченного фрагмента и быстро проверить, насколько новая гипотеза согласуется с уже знакомыми текстами. То, на что раньше уходили недели или даже месяцы ручной работы, сегодня нередко занимает всего несколько минут.
Что нейросети уже делают уверенно
Самая сильная сторона нынешних моделей — поиск повторяющихся последовательностей и восстановление пропусков. Система видит тысячи примеров и предлагает, какие знаки с наибольшей вероятностью стояли на месте скола. При этом она может учитывать не только текст, но и изображение самой надписи. Так устроены современные мультимодальные сети, которые одновременно обрабатывают визуальную форму и лингвистический контекст.
Второй полезный навык — поиск соответствий между родственными языками. Если известна языковая семья, модель может искать регулярные фонетические и лексические параллели и использовать их для проверки возможных чтений. Это заметно ускоряет работу, когда хотя бы отдаленное родство уже установлено, и позволяет отсеивать заведомо слабые гипотезы на раннем этапе.
Третье — массовая проверка предположений. Исследователь выдвигает идею, что определенный знак читается так-то, а машина за несколько минут прогоняет ее по всему доступному материалу и показывает, где гипотеза держится, а где разваливается. Раньше такая проверка могла занять год ручной работы. Современные технологии позволяют не только тестировать отдельные чтения, но и оценивать устойчивость предложенной фонетической системы на всем корпусе сразу.

Четвертое направление — датировка и географическая привязка. Модель, обученная на десятках тысяч датированных надписей, умеет предлагать вероятный век и регион происхождения для нового фрагмента. Это особенно ценно, когда надпись вырвана из контекста или найдена случайно. Такие системы уже умеют выдавать распределение вероятностей по провинциям и временным диапазонам, а не одну жесткую дату.
Реальные примеры применения ИИ
В июне 2026 года инженер и независимый исследователь Саймон Кордвелл (Simon Cordwell) опубликовал работу, посвященную линейному письму А. Он предложил гипотезу, согласно которой одно из слов в сохранившейся молитвенной надписи связано с семитским корнем со значением «обитать», а затем написал программу, которая проверила эту идею на всех доступных текстах. Автор предложил чтение для 40 знаков и составил словарь из 408 слов. Результаты исследования пока проходят экспертную оценку, поэтому говорить о расшифровке языка еще рано. Тем не менее она хорошо показывает, как современные алгоритмы помогают быстро проверить гипотезу и отбросить варианты, которые плохо согласуются с имеющимися данными.
Другой яркий пример — свитки из Геркуланума. Они обуглились при извержении Везувия и столетиями лежали свернутыми. Физически развернуть их почти невозможно — материал рассыпается. Команда Брента Силза и участники Vesuvius Challenge научились делать томографию и с помощью нейросетей «разворачивать» слои виртуально, а затем распознавать чернила. В 2026 году впервые удалось полностью развернуть один свиток длиной почти полтора метра. Там обнаружились фрагменты философского трактата, близкого к идеям стоицизма. Появились и уточнения по сочинениям Филодема. Без машинного зрения и моделей, обученных находить следы чернил на обугленной поверхности, эти тексты так и остались бы недоступными.
Google DeepMind выпустила модель Aeneas специально для латинских надписей. Она работает сразу с текстом и изображением, умеет предлагать заполнение пропусков длиной до 10 знаков с точностью около 73% в топ-20 вариантов, определять провинцию происхождения с точностью 72% и датировать текст с ошибкой примерно в 13 лет. Модель обучена на более чем 176 тыс. латинских надписей из нескольких крупных эпиграфических баз. Историки, которые пробовали работать вместе с Aeneas, отмечали, что система часто подсказывает параллели, которые человек мог бы искать неделями.
Еще раньше появилась Ithaca — сеть для древнегреческих надписей. Она восстанавливает поврежденные тексты, определяет вероятное место их создания и помогает датировать находки. В испытаниях модель правильно восстанавливала текст в 62% случаев, определяла место происхождения с точностью 71%, а датировку — с погрешностью до 30 лет. Когда историки использовали ее подсказки, качество их работы выросло с 25 до 72%. Предшественница Ithaca — модель Pythia — также показала, что нейросети могут восстанавливать древнегреческие надписи точнее, чем человек, работающий без такой помощи.
Отдельное направление связано с оракульными костями Древнего Китая — древнейшими памятниками китайской письменности. Многие знаки на них плохо сохранились или встречаются настолько редко, что определить их первоначальный вид бывает непросто. Здесь на помощь приходят генеративные состязательные сети: они предлагают наиболее вероятные варианты утраченных или поврежденных знаков, сравнивая их с более поздними иероглифами. Однако окончательное решение все равно остается за исследователями. Практика показывает, что лучшие результаты дает совместная работа человека и нейросети, а не полностью автоматическая реконструкция.
Что пока не под силу нейросетям
Самая большая проблема в том, что нейросеть не может узнать то, чего нет в исходных данных. Если о языке сохранилось слишком мало сведений, никакой алгоритм не сможет «догадаться», как он был устроен. Обычно ученым помогает хоть какая-то подсказка: двуязычная надпись, родственный язык или большое количество текстов, смысл которых уже удалось хотя бы частично установить. Когда ничего этого нет, любая версия остается лишь предположением. Именно поэтому линейное письмо А и сегодня считается нерасшифрованным, несмотря на множество интересных гипотез.
Не менее серьезная проблема — количество сохранившихся текстов. Чем их меньше, тем выше вероятность принять случайное совпадение за настоящую закономерность. Если в распоряжении исследователей всего несколько десятков или сотен коротких надписей, модель почти всегда сможет подобрать правдоподобное объяснение. Но это еще не означает, что оно верное. Поэтому сообщения об очередной «полной расшифровке» древнего языка научное комьюнити всегда встречает очень осторожно. Чтобы новая гипотеза получила признание, ее должны подтвердить и другие исследования.
Есть и еще одна трудность. Даже если нейросеть научится очень точно восстанавливать утраченные знаки или продолжать текст так, что он выглядит убедительно, это еще не означает, что она понимает его смысл. Она предсказывает наиболее вероятный вариант, опираясь на уже известные примеры, но не знает, о чем на самом деле говорится в надписи. Поэтому современные модели пока остаются инструментом, который помогает исследователям быстрее проверять идеи и находить возможные решения, а не системой, способной самостоятельно расшифровать забытый язык.
Что дальше
Возможности таких систем продолжают расти. Появляются новые модели для отдельных древних письменностей, совершенствуются методы распознавания поврежденных надписей по фотографиям и трехмерным сканам, а цифровые базы постоянно пополняются новыми находками. Чем больше качественных данных получают исследователи, тем точнее становятся и сами алгоритмы.
При этом ждать, что нейросеть в ближайшие годы самостоятельно расшифрует любой забытый язык, пока не стоит. Но уже сегодня она помогает выполнять за часы работу, которая раньше занимала недели или месяцы: восстанавливать утраченные фрагменты текстов, быстрее проверять новые гипотезы и находить связи, которые человеку было бы очень сложно заметить. Скорее всего, именно это и станет главным вкладом ИИ в историческую лингвистику.
Zippy
Вот расшифрует книгу Войнича тогда и булет о чем говорить