Когда надо что‑то узнать об инструменте или сервисе, мне хочется сначала посмотреть, что о них пишут другие люди.

И за последний год эта привычка начала сбоить. Страничек в интернете не стало меньше, наоборот их количество выросло. Просто из восьми открытых вкладок семь рассказывают одно и то же, одними и теми же оборотами, в одном и том же порядке. 

Я понимаю, что текст скорее всего писал не человек. Это была ИИ‑модель, скорее всего не шибком мудрёная и без грамотного промта. Для ИИ весь мир, вся информация, весть текст — это просто токены. Строки наподобие «RFg♴4#‑f体$fÆmZ» и любая другая в конечном счете лишь набор чисел. Смысл за ними придумываем МЫ — человеки. И пытаемся донести этот смысл до нейросети, во время ее обучения. Текст у искусственного интеллекта это ни рыба, ни мясо — что‑то усредненное между всеми обучающими данными.

Вот и интернет становится — усредненным. Истина и замысел размывается.


Вавилон

Аргентинский прозаик Хорхе Луис Борхес в 1941 году придумал рассказ про библиотеку, в которой стоят все возможные книги. Не все написанные, а все возможные, то есть любые сочетания знаков, какие вообще можно уложить в книгу. Среди них лежат все настоящие тексты человечества, все их черновики, все переводы и все опечатки к ним.

Рассказ называется «La biblioteca de Babel», что переводится как «Вавилонская Библиотека». Очень советую прочитать рассказ тому, кто еще этого не сделал. Он коротенький и гуглится за пару секунд.

Так вот, интернет, по моему скромному мнению, приближается к такому состоянию «библиотеки». Но хуже. 

Что случилось в шестигранниках

Рассказ «La biblioteca de Babel» вышел в сборнике «El jardín de senderos que se bifurcan» в 1941 году.

Библиотека из рассказа это мир состоящий из шестигранных комнат. Стены комнат это полки с книгами. 

Всего двадцать полок, по пять длинных полок на каждой стене; кроме двух: их высота, равная высоте этажа, едва превышает средний рост библиотекаря. 

99.9% этих книг по сути просто шлак и бред. Ну из‑за бесконечности вариантов этих книг, по закону больших чисел там можешь содержаться абсолютно всё: точная биография в вашей жизни, перевод библии на несуществующие языки, словарь к этому не существующему языку, каталог где указано место всех словарей в библиотеке, кулинарная книга из звёздных войн, ответы на любые вопросы человечества и даже вопросы, о которых это человечество ещё не задумывалось. 

Всё естество людей из этого рассказа весь их смысл жизни это поиск той самый книги(они называют их Откровениями), которые укажут смысл их жизни предскажет их судьбу и будущее. Моря бессмыслицы, десятки тысяч часов тщетных поисков.

Белый шум хуже абракадабры

Возвращаемся к нашему искусственному интеллекту. 

ChatGPT и другие LLM, всё‑таки не совсем Вавилонская Библиотека. Их ответы — не случайный набор букв, а предсказания, основанные на обучающих данных, в которых собраны огромные объёмы написанных людьми текстов. 

Они не содержат всего на свете и не способны воспроизвести всё, что когда‑либо было сказано или написано. Поэтому, говоря о таких системах, важно помнить: это технологии с собственной историей. На них влияют предубеждения исходных данных, бесчисленные мелкие решения людей, которые их создают, а ещё законы и культурные нормы, из‑за которых разработчики стараются не допускать определённых ответов.

И всё же, если говорить именно об источниках информации, мне кажется, что большие языковые модели гораздо ближе к Библиотеке, чем к большинству других привычных нам аналогий.

Например, LLM — это точно не калькулятор.

Калькулятору можно доверять, потому что тот обычно прав, а когда округляет периодическую дробь, ошибается предсказуемо. Модель ошибается гораздо менее предсказуемо. Если она выдаёт неправильный ответ, заранее предсказать, каким именно будет её ошибка, гораздо сложнее.

Поиск информации руками тоже может привести к неверному ответу, но обычно рядом остаются ссылки на источники. Пользователь, который умеет искать, может открыть их, оценить качество и понять, насколько найденное соответствует его задаче. (да, ИИ выдача тоже берет источники как вводные данные, и все равно ошибается, причем очень спонтанно. Один раз мы поспорили с товарищем о том, являются ли два слова однокоренными или нет «порода» и «род». ИИ с уверенностью сказал, что являются, и корень у обоих род. ИИ также прикрепил ссылку на источники. И во всех источниках говорится, что это не так. У слова «порода» корень пород, а не род. Что заставило модель ошибиться, имея на руках правдивые источники, не ясно.)

И самое важное. Доверие к книге, сайту, прибору или человеку держится на вере, что кто‑то сверил сказанное с реальными обстоятельствами. Репортёр говорил со свидетелями, исследователь ставил эксперимент, инженер калибровал прибор. Люди врут и ошибаются, но даже врут с апелляцией к чему‑то внешнему. Ни книги из шестигранников, ни сырой ответ модели с обстоятельствами не сверялись ни разу.

OpenAI предупредила об этом сама, объявляя research preview в ноябре 2022 года. Система «иногда даёт убедительно звучащие, но неправильные или бессмысленные ответы», то есть иногда выдаёт правдоподобный, но неверный или бессмысленный ответ. Починить это трудно, потому что при обучении с подкреплением «на данный момент нет источника правды».

Мертвый язык

Вот замер за май 2025 года. Ahrefs прогнали 900 тысяч новых англоязычных страниц за апрель, по одной странице на домен. След ИИ нашёлся на 74,2% страниц. Но если разложить всю выборку по типам, полностью сгенерированных там всего 2,5%, полностью человеческих 25,8%, а остальные 71,7% это смесь, где человек и модель писали вместе. 

Ещё они опросили 879 контент‑маркетологов, и 87% признались, что ИИ так или иначе используют. Детектор не идеален, сами авторы это оговаривают.

Другие цифры. Graphite в мае 2026 года взял 55,4 тысячи случайных адресов из Common Crawl, оставил англоязычные статьи и статьи‑списки с разметкой article не короче ста слов, опубликованные с января 2020 по март 2026, прогнал их через три детектора (Pangram, Copyleaks и GPTZero) и усреднил квартальные доли.

Считают тут иначе, чем у Ahrefs. Там искали любой след машины на странице, здесь ищут статьи, где машинного больше половины.

Через двадцать четыре месяца после запуска ChatGPT доля преимущественно машинных статей дошла до 48 процентов. В четвёртом квартале 2025 года машинные впервые обогнали людей, 50,9 процента. Последние пять кварталов линия держится около половины, то есть это уже не разгон, а плато.

Данные Graphite 
Данные Graphite 

Однако около половины новых англоязычных статей в их выборке из Common Crawl, а никакая не половина интернета. Разница огромная, размывать её я бы не стал.

Почему это плохо? Ну помимо того, что приходится читать сгенерированный шлак, это также будет плохо влиять на дальнейшее обучение моделей. Обучаюсь на сгенерирован текстах ИИ троекратно переваривает смыслы и истину. И происходит усреднение уже усредненного.

Shumailov и соавторы в Nature показали, что безразборчивое обучение на сгенерированном тексте даёт необратимый дефект. Если исходные человеческие данные при этом не удерживать, деградация копится от поколения к поколению. (прям таки нейронный инцест)

Оговорюсь и здесь. Это результат про рекурсивное обучение моделей, а не доказательство того, что интернет уже коллапсировал. Второе из первого не следует.

Но мы же все можем подключить внутренних аналитиков и сделать свой небольшой прогноз.

Дефицит не текста, а проверки

Если сложить всё вместе, получается неприятная арифметика. Текста, который выглядит как знание, каждый год становится больше. Людей, которые выходят из шестигранника и сверяют написанное с миром, больше НЕ становится. Информация НЕ проверяется, все принимается за чистую монету.

Вот почему я не готов свести всё к совету научится лучше читать. Навык поиска и проверки информации был и раньше, но раньше он опирался на веб, где источник хоть куда‑то вёл. Скоро ссылка будет вести на почти такую же статью, просто написанную другими словами, то истина размывается в потоке пересказов.

Сегодня мы сами допускаем и по сути строим веб, в котором само понятие истины будет постепенно утрачиваться.

У библиотекарей из рассказа было оправдание, которого нет у нас. Их библиотека существовала с начала времен(очень очень давно), они в ней были обитателями, а не авторами. Наша ещё пишется, и фактически уже не нами.

Так что вопрос не в том, отключать ли ИИ или запретить ему писать. Вопрос в том, как найти истину, в океане её иммитирующем.

Комментарии (17)


  1. alexzen
    19.09.2026 16:08

    По факту я вижу другое.

    Кривые, косые, с орфографическими ошибками тексты инфлюенсеры отдают ИИ и получется вполне читабельный и интересный материал.

    Вместо копания в статьях Гугла, в 90% случаев я получаю от ИИ то, что мне нужно.

    ИИ более интеллектуальный и честный собеседник, чем среднестатистический обыватель.

    Сейчас главный тормоз достоверности информации - это человек. В отличие от ИИ у него есть злой умысел не писать правду.


    1. Serega_Biven
      19.09.2026 16:08

      бро не надо усреднять всех с собой. мне , моей бабуле и догу и еще нескольким миллионам человек не интересно читать слоп . и да я пользуюсь не аи поиском , а вместо туалетной бумаги использую бересту . ваш ход


  1. Notrado
    19.09.2026 16:08

    Если сложить всё вместе, получается неприятная арифметика.

    Ощущается флёр бексконечно ломающейся логики.


  1. silicon_stone
    19.09.2026 16:08

    И какая-какая, говорите, этимология слова "порода"?! По вашим словам "порода" и "род" - не однокоренные. С источником этого лингвистического откровения хотелось бы ознакомиться ))


    1. torbasow
      19.09.2026 16:08

      Порода.

      Тихонов А. Н. Морфемно-орфографический словарь. — М. : Школа-Пресс, 1996.

      Лично я, правда, нахожу это странным и по меньшей мере не бесспорным.


      1. silicon_stone
        19.09.2026 16:08

        Понимаете, нужно использовать не школьные определения, а смотреть в этимологию. У слов "народ", "урожай", "порода", "зарождение" (и "порождение") - корень один: "род" как нечто generation, произошедшее, порождённое от чего-то. Т.е. у нас два уровня: 1. Школьный разбор существительных на приставку, корень, суффикс и окончание и 2. Лингвистический анализ происхождения слова (этимология). Так вот, с этимологической точки зрения - корень у этих слов один. А с позиции школьной училки... это какая училка попадётся.

        Как-то так.


        1. torbasow
          19.09.2026 16:08

          Я-то понимаю.
          Чтобы посадить ИИ в лужу, стоило подобрать другой пример.


        1. Balarama818
          19.09.2026 16:08

          Ха-ха, «народ». Я помню как классе в третьем пытался доказать кому-то, что в этом слове праиндоевропейский корень «-нара-», означающий «человек». Мне объяснили, что все проще, и этимология банальна – «род».

          А ведь, держу пари, какой-нибудь льстивый gpt поддакивать бы начал) Надо проверить…


  1. AlekseyPraskovin
    19.09.2026 16:08

    У слова «порода» корень пород, а не род

    Чё, простите? А что означает слово "пород", которое по вашему является там корнем?


  1. AlekseyPraskovin
    19.09.2026 16:08

    Когда надо что‑то узнать об инструменте или сервисе, мне хочется сначала посмотреть, что о них пишут другие люди

    Понимаете, ли, голубчик, в чем дело: уровень среднего обывателя модели уже давно превзошли. В том числе по связности изложения. Если уж брать ваш пример, то "что пишут люди" разложится примерно на следующее:

    1. Холивар вокруг языка программирования, на котором написан сервис. Как будто мне, как пользователю, на это не насрать...

    2. Холивар вокруг "а нужен ли вообще сервис". Очень содержательно, да...

      1. Перечисление 100500 методов делать почти то же самое другим инструментом/сервисом (можно блины есть с лопаты, да)

      2. Обсуждение личностей тех, кто использует сервис vs тех, кто его не использует. С обязательным перекрестным приглашением матерей участников дискуссии на ночной сеанс в кино

    3. Холивар вокруг владельца сервиса в связке с его ценой. Невероятно ценная для меня как потребителя информация, что Вася считает 10$ большой суммой, а Андрей считает 1000$ маленькой.

    4. ...

    5. Обсуждение Гитлера, граммофона, гуттаперчевых мальчиков, гудрона, гидроизоляции, сравнительных достоинств свиного и говяжьего гуляша

    И вот из этой горы говна я как потребитель пытаюсь вытащить информацию о сервисе/инструменте.


  1. lazarus_net
    19.09.2026 16:08

    Ещё они опросили 879 контент‑маркетологов, и 87% признались, что ИИ так или иначе используют. Детектор не идеален, сами авторы это оговаривают.

    А до эпохи ИИ сайты били полны полезной информации?

    Ищешь хелп по какой нибудь команде Linux, поисковик выдает 100500 млн страниц, открываешь первую:

    Баннер -картинка на 2/3 экрана, дальше растекания автора мыслью по древу - экранов так на 2-3 как минимум, где-то в середине запрятана строчка с примером который нужен.

    Это ещё лучший вариант, некоторые специалисты видео на 30 минут генералитет где большая часть это авторское «А… ну вот вроде как …»

    Теаепрь задаешь вопрос- получаешь ответ с примерами. Если текста много - говоришь - сократи - и все дела.

    Про что-то что хоть как-то связано с товарами в продаже вообще искать невозможно стало: попробуйте погуглить про стандарты утепления/отопления домов . Вам выдадут кучу ссылок на конторы которые строят/продают и ни слова про то что вам надо.

    Интернет убили копирайтеры задолго до АИ, АИ спас его- вернул текст и достаточно конкретный.

    Проверить что пишут люди - нельзя так как все отзывы либо накручены либо только позитивные.


    1. silicon_stone
      19.09.2026 16:08

      Ну, проблема ИИ в том, что он сейчас учится на текстах тех самых копирайтеров. Это даже не отравление данных, это нейтронная бомба ))


    1. AlekseyPraskovin
      19.09.2026 16:08

      поисковик выдает 100500 млн страниц... Баннер -картинка на 2/3 экрана, дальше растекания автора мыслью по древу - экранов так на 2-3 как минимум, где-то в середине запрятана строчка с примером который нужен

      Ну такие были правила игры. Не растекаешься на 2-3 экрана? Поисковик тебя не выдает. Вообще. И ты пытаешься выживать на прямых переходах постоянной аудитории. Такие ресурсы были, форумы назывались. Подскажите, где они сейчас?