MT Статьи

Когда семь человек носят ваше имя

Опубликовано — 7 мин чтения

Быть невидимым — проблема. Быть принятым за другого — проблема больше, потому что читающий не знает, что это неверно.

Поисковые системы годами с трудом различают людей с одинаковым именем. Страница результатов показывает это честно: десять синих ссылок, принадлежащих разным людям, и вы сами выбираете, кто есть кто.

Ответы ИИ эту честность утратили. Они не предлагают десять вариантов; они дают один ответ. И если при его создании смешались данные нескольких людей, получается человек, которого не существует.

Конкретный пример

Поисковику задали вопрос «кто такой Murat Tunalı» — причём доменное имя было явно добавлено в запрос. Вернулось вот что:

Murat Tunalı, родившийся в Измире в 1982 году, — мужской парикмахер и педагог-писатель. Соединяя классическое цирюльное искусство с современным подходом к уходу, Туналы работает в Бурсе как премиальный мужской парикмахер. Кроме того, он специалист по семейному консультированию и оказывает консультационные услуги в Стамбуле.

В этом абзаце как минимум три разных человека: парикмахер в Бурсе, автор родом из Измира, семейный консультант в Стамбуле. Все трое реальны. Все трое — разные люди. Ответ не совпадает ни с одним из них.

Это не «галлюцинация» — ничего не выдумано. Каждая фраза откуда-то взята. Проблема в слиянии: модель принимает фрагменты, привязанные к одному имени, за одну личность.

Почему так происходит

Три механизма накладываются друг на друга.

Имя — не личность. Для языковой модели «Murat Tunalı» — это строка; связывает её с сущностью окружающий контекст. Если контекст слаб, всё привязанное к той же строке собирается в один котёл.

Поиск приносит ближайшее, а не самое верное. Поисковый слой достаёт документы, похожие на запрос. Страницы семи человек все похожи на запрос «Murat Tunalı». Затем модель читает эти семь источников и пишет одну сводку — а составление сводки по своей природе есть слияние.

Она чувствует себя обязанной ответить. Классическая страница результатов может сказать «вот десять результатов». Чат-интерфейсу пришлось учиться говорить «не знаю», и он делает это не всегда.

В том же эксперименте другая машина поступила наоборот: сказала, что «не смогла найти профиль, чётко соответствующий этому описанию», и перечислила близкие по имени варианты. Те же данные, иное поведение. Разница — в позиции продукта по отношению к неопределённости.

Побеждает тот, кто весит больше

Что решает, кого из семи носителей имени считать «тем самым», — не правильность, а измеримый вес.

Одно измерение: сколько записей у двух одноимённых доменов в открытом архиве обходов — одном из источников, питающих обучающие данные больших языковых моделей.

Период обходаНовый сайтВосемнадцатилетний тёзка
Июль 2026022
Июнь 2026036
Май 2026026

Архив также хранит непрерывный ряд с 2007 года: 158 снимков. Изданные книги, авторские страницы у книготорговцев, словарная статья.

Против этого стоит сайт возрастом в один день. Качество его страниц может быть лучше — безупречные структурированные данные, полный многоязычный слой, чистая техническая база. Ничто из этого не считается. Если вас нет в корпусе, модель вас не знает.

То же измерение дало ещё более резкое сравнение: сайт всего с 238 словами и полностью без структурированных данных держал шестнадцать записей в этом архиве. Совершенство страницы само по себе не создаёт присутствия в корпусе. Его создают возраст и упоминания.

Почему это не обычная SEO-проблема

В классическом поиске проблема тёзок раздражает, но управляема: пользователь смотрит список и выбирает нужного. Кликнул не туда — вернулся назад.

В ответе ИИ возврата нет. Пользователь читает единственный ответ и идёт дальше. Если ответ неверен, узнать об этом тоже негде.

Когда работодатель, клиент или журналист спрашивает про ваше имя, а выходит не вы, цена лежит в иной категории, чем «низкая позиция». Невидимость вычёркивает вас из списка; неверное представление вносит вас в чужой список.

Как проверить себя

Выяснить, ваша ли это проблема, занимает полчаса и не требует инструментов.

Первое — спросите своё имя. Задайте трём разным ИИ-интерфейсам вопрос «кто такой X». Прочитайте ответ и отметьте каждую фразу: какая относится к вам, какая нет. Если есть слияние, попробуйте проследить, от кого какая часть; обычно это удаётся.

Второе — добавьте свой домен в запрос. Скажите «кто такой X, [ваш домен]». Если машина по-прежнему описывает другого, проблема глубже узнавания: она не может связать вас, даже получив ваш собственный источник.

Третье — спросите без бренда. Не упоминая имени, задайте вопрос, описывающий, чем вы занимаетесь и где. Это ваше настоящее измерение видимости, независимое от проблемы тёзок. Если ваших тёзок там тоже нет — это открытое поле.

Четвёртое — загляните в архив. Сколько записей у вашего домена в открытом архиве обходов и сколько у домена тёзки? Отношение этих двух чисел хорошо предсказывает, какого человека «узнает» модель.

Пятое — попробуйте неверное написание. Если в имени есть национальные символы (ı, ş, ğ, é, ñ, ö), спросите и про упрощённую форму. Большинство систем считает эти две строки разными сущностями.

Итог этих пяти шагов — не список, а диагноз: ваша проблема в невидимости или в неверной идентификации? Им нужны разные лекарства. Невидимость лечится временем и упоминаниями. Неверная идентификация не лечится — ею управляют.

Частая ошибка

Большинство услышавших о проблеме тёзок первым делом добавляет ключевые слова: пишет своё имя на странице чаще, наполняет им заголовки, ставит трижды в мета-описание.

Это не работает, потому что проблема в контексте, а не в частоте. Машине для различения нужно не то, сколько раз встречается имя, а то, с чем оно встречается. Город, профессия, технология, организация, дата — это различает. Повторённое имя — нет.

И правда, на измеренном сайте находкой было то, что имя вообще не встречалось в основном тексте; но исправление звучало не «напиши имя десять раз». Оно звучало «напиши имя один раз, вместе с профессией и городом, в предложении от третьего лица».

Что работает

Три группы сигналов отличают вас в толпе тёзок. Ни одна не достаточна сама по себе; они работают вместе.

1. Явное разделение в структурированных данных

У Schema.org для этой самой задачи есть поле, и большинство сайтов оставляет его пустым: disambiguatingDescription. Оно создано, чтобы разделять сущности с общим именем.

{
  "@type": "Person",
  "name": "Murat Tunalı",
  // В том числе вариант без национальных символов
  "alternateName": ["Murat Tunali", "M. Tunalı"],
  "disambiguatingDescription":
    "Системный инженер в Стамбуле, создающий веб-приложения на базе ИИ;
     не имеет отношения к тёзкам — автору по личностному развитию
     и семейному консультанту.",
  "jobTitle": "Системный инженер",
  "knowsAbout": ["Веб-приложения на базе ИИ", "Сети и безопасность"]
}

Это поле — не сигнал ранжирования. Его задача — сказать машине, пока она пытается связать вас с сущностью, какой сущностью вы не являетесь.

2. Двусторонняя связь профилей

Поле sameAs перечисляет ваши профили. Но односторонний список — слабый сигнал: вы говорите «это мой GitHub», а GitHub этого не подтверждает.

Правильная схема взаимна — от профиля к сайту и от сайта к профилю. Двусторонняя связь принадлежит к иному классу доказательств, чем одностороннее утверждение.

Писать sameAs, который нельзя подтвердить, вредно. Перечислять профиль, которого нет или который не ваш, не укрепляет граф сущностей; он его засоряет.

3. Определяющая фраза в основном тексте

Это упускают чаще всего. Страница может нести ваше имя в теге <title> и в структурированных данных и ни разу не упомянуть его в тексте.

Когда языковая модель режет вашу страницу на фрагменты и встраивает их, эти фрагменты — всё, что у неё есть. Если во фрагменте нет имени, этот фрагмент не отвечает на вопрос «кто это».

Решение — одна фраза: третье лицо, одна строка, имя + профессия + место. Её можно поставить под существующим повествованием, не нарушая тона текста.

Что объединяет эти три: ни одно не является уловкой ранжирования. Все три облегчают работу, которую машина и так пытается делать, — правильно связать сущность.

Чего я не сделал

У этой проблемы есть соблазнительное, но неверное решение: завести запись в Wikidata.

Wikidata — якорь графов сущностей, и присутствие там действительно различает. Когда я проверил во время измерения, поле было совершенно пустым — записи не было ни у меня, ни у одного из семи тёзок.

И всё же она не была заведена. У Wikidata есть порог значимости, и однодневный сайт с нулём независимых упоминаний и нулём изданных работ его не проходит. Насильно созданная запись удаляется и оставляет негативный след на домене.

Правильный порядок такой: сначала в независимых источниках накапливаются настоящие упоминания, и тогда запись становится защитимой сама собой. Имитировать результат сигнала вместо того, чтобы производить его у источника, исправляет измерение, но не истину.

Сколько это займёт

Честный ответ: не знаю, и никто не знает.

Известно вот что: обучающие корпуса обновляются периодически, поисковые индексы — намного быстрее, а «узнаваемость» сущности в модели зависит от накопления упоминаний. Обогнать восемнадцатилетнего старожила за квартал нереально.

Реально сменить поле боя. Само имя в краткосрочной перспективе — невыигрываемый запрос. Но связки «имя + признак» и сервисные запросы, где бренд вовсе не упоминается, — вот открытое поле. Ни одного из тёзок в этих запросах нет.

В моём собственном измерении самой ценной метрикой была не доля цитирования. Это было появление в запросах без бренда — потому что тот, кто знает ваше имя, и так вас ищет; настоящий выигрыш в том, чтобы вас нашёл тот, кто его не знает.

В этом есть кое-что успокаивающее. Толпа тёзок, возможно, хоронит вас в одном запросе, но этот запрос всё равно не был самым ценным. Тот, кто ищет ваше имя, чаще всего вас уже знает. Тот, кто не знает, пишет не ваше имя, а свою задачу — и на этом поле вы соревнуетесь не с семью людьми, а с темой.