SparkToro в начале 2026 года провёл эксперимент на 600 добровольцах: одни и те же 12 промптов прогнали через ChatGPT и Google AI почти три тысячи раз.[1] Результат: шанс получить одинаковый список рекомендованных брендов на два одинаковых промпта — меньше одного из ста. Шанс получить тот же список ещё и в том же порядке — примерно один из тысячи. Это значит, что цифра "видимость бренда 42%", которую вам показали на одном-единственном прогоне демо, могла бы с равной вероятностью оказаться 30% или 55% при следующем запуске того же самого промпта.
Ставки на ошибку при выборе такого инструмента высоки и без ИИ-специфики: любая корпоративная подписка на год вперёд обходится дорого, если методология измерения оказывается несостоятельной уже через пару месяцев. Демо — единственный момент, когда можно проверить методологию до подписания контракта, а не после того, как отчёты перестанут сходиться с реальностью.
Дальше расскажем, что именно спрашивать и на какие детали смотреть, чтобы не купить красивый дашборд вместо работающего измерения.
Показательно, что оба риска складываются вместе. Инструмент с нестабильной методологией измерения — это ровно тот тип покупки, о которой сожалеют чаще всего. Цифры на демо выглядят убедительно, а через два-три месяца использования отчёты перестают совпадать с тем, что видно вручную в самих чат-ботах, и команда теряет доверие к инструменту в целом, а не только к одной метрике.
Раздел 01
Почему нельзя доверять цифре с первого экрана демо?
Потому что один прогон промпта показывает случайную точку, а не устойчивый результат. Раз вероятность получить идентичный список брендов на повторном прогоне меньше одного из ста, единственная цифра "видимость X%" без указания, сколько раз и когда проводился замер, не говорит почти ничего о реальном положении бренда.
- На демо стоит прямо спросить: сколько раз прогоняется каждый промпт перед тем, как в отчёт попадает итоговое число, и показывает ли инструмент разброс между прогонами, а не только среднее. Если продавец не может ответить на этот вопрос сходу, скорее всего инструмент действительно строится на одном прогоне за раз, а не на устойчивой выборке.
- Спросить, сколько повторных прогонов делается на один промпт перед агрегацией.
- Попросить показать разброс значений между прогонами, а не только итоговое среднее.
- Уточнить, как часто повторяется полный цикл измерения — раз в день, в неделю, в месяц.
- Попросить прогнать один и тот же промпт дважды прямо на демо и сравнить результат. Здесь же стоит уточнить, как именно агрегируется итоговая цифра из нескольких прогонов. Простое среднее арифметическое ведёт себя иначе, чем медиана или доля прогонов, где бренд появился хотя бы раз. При высокой изменчивости эти способы подсчёта дают заметно разные числа на одних и тех же сырых данных, и понимание метода агрегации не менее важно, чем количество самих прогонов.
Раздел 02
Какие два показателя обязательно должны быть разделены, а не слиты в один индекс?
AI Share of Voice и Citation share — это разные метрики, и хороший инструмент показывает их раздельно, а не растворяет в одном общем "индексе видимости". Share of Voice — доля промптов, где бренд вообще упомянут, независимо от ссылки. Citation share — доля промптов, где процитирован именно ваш URL, а не сторонний источник или конкурент.
Бренд может звучать в ответе модели, а трафик и доверие при этом достаются агрегатору или обзорному сайту, который указан источником. Инструмент, который показывает только один смешанный процент "видимости", не даёт возможности увидеть эту разницу, а значит, не даёт и понять, что именно чинить дальше — контент, ссылки или сам продукт.
Попросите на демо конкретный пример карточки находки: реальный промпт, статус ответа (бренд отсутствует, упомянут, процитирован, рекомендован или описан неверно), какой именно URL попал в ответ, и чей это источник — собственный домен, сторонняя площадка или прямой конкурент. Если инструмент в принципе не хранит такую карточку на уровне отдельного промпта, а сразу агрегирует всё в общий процент, восстановить причину провала задним числом будет нечем.
Раздел 03
Сколько ИИ-движков должен показывать инструмент и почему их нельзя усреднять?
Ahrefs в конце 2025 года проанализировал 730 000 пар ответов Google AI Overviews и Google AI Mode на одинаковые запросы.[2] Даже у двух ИИ-поверхностей одной компании, отвечающих на один и тот же вопрос, один и тот же URL в источниках совпал только в 13,7% случаев, при том что смысловое сходство самих ответов было на уровне 86%. Модели могут прийти к одному и тому же выводу, но процитировать при этом совершенно разные страницы.
Если даже две системы одного вендора расходятся в выборе источника в 86 случаях из 100, усреднённый показатель по всем ИИ-движкам сразу маскирует реальную картину почти гарантированно. На демо стоит требовать разбивку по каждой системе отдельно, а не общий процент.
| Движок | На что обратить внимание в демо |
|---|---|
| ChatGPT | Широкий охват, отдельно ли считается ChatGPT search от обычных ответов модели |
| Perplexity | Показывает ли инструмент, что Perplexity строже относится к источникам и чаще ссылается на первичные данные |
| Google AI Overviews | Разведены ли AI Overviews и AI Mode как две разные поверхности, а не одна усреднённая цифра "Google" |
| Google AI Mode | Отслеживается ли отдельно, учитывая кардинально другую логику retrieval и мультимодальные запросы |
| Claude | Показано ли, что Claude консервативнее в выборе источников и тяготеет к авторитетным публикациям |
| Яндекс Нейро / Алиса | Есть ли вообще в списке движков для русскоязычной аудитории |
Раздел 04
Как проверить методологию промптов, на которых строится отчёт?
- Попросите показать сырой список промптов, а не только итоговые графики. Хороший инструмент строит промпты по иерархии "тема, затем промпт, с 10–25 темами на бизнес и 10–25 реальными формулировками на тему", а не берёт единственную обобщённую фразу вроде "лучший поставщик X".
- Отдельно стоит спросить, вписывается ли название бренда в сам промпт при тестировании. Если да, то результат покажет только то, что бренд там есть, потому что его туда вписали, а не потому что его выбрала модель сама, и вся отчётность строится на искажённом baseline с первого дня.
- Попросить показать 15–20 реальных промптов из отчёта, а не только агрегированные цифры.
- Уточнить, разведены ли информационные и коммерческие промпты в отчёте раздельно.
- Проверить, есть ли в тестовых промптах прямое упоминание бренда, искажающее результат.
- Спросить, кто составляет промпты — алгоритм по ключевым словам или реальный анализ вопросов покупателей. Полезная проверка на месте: попросить вендора составить три-четыре новых промпта прямо на встрече, специфичных именно для вашей ниши, и прогнать их вживую. Если инструмент справляется только с заранее подготовленным демонстрационным набором, а на свежих формулировках теряется или выдаёт нерелевантный результат, это раскрывает реальные границы методологии куда быстрее, чем любые слайды.
Раздел 05
Насколько свежие данные показывает инструмент?
Спросите дату последнего полного цикла измерения и частоту повторного прогона. Разовый снимок устаревает быстро: платформы меняют алгоритмы retrieval, конкуренты публикуют новый контент, и данные месячной давности на демо могут не отражать текущую картину вообще.
Хороший ответ на этот вопрос звучит конкретно. Например, "полный цикл по всем темам — раз в неделю, точечная проверка ключевых промптов — ежедневно". Расплывчатый ответ вроде "мы обновляем данные регулярно" без конкретной частоты — повод переспросить ещё раз, уже с примером на реальном отчёте.
Раздел 06
Даёт ли инструмент план действий, или только красивый дашборд?
Хороший инструмент закрывает всю цепочку: измерение, диагностика причины, конкретная задача на исправление и повторная проверка результата. Плохой останавливается на первом шаге и оставляет разбираться с находками самостоятельно.
Показательный пример полного цикла — как устроена платформа Humanswith.ai. Агент Hermes еженедельно сканирует ответы девяти ИИ-движков и строит трёхуровневый скоринг для каждого: присутствует ли бренд в ответе вообще, на каком месте среди упомянутых вариантов, и как именно сформулирован контекст упоминания. Дальше находки передаются в ContentOS, который собирает бриф и черновик именно под обнаруженный пробел, проверяя уникальность и признаки ИИ-генерации ещё до публикации, а не постфактум. Content Publisher оформляет публикацию с canonical-URL и корректной schema.org разметкой автоматически, без ручного заполнения полей. То есть находка не остаётся отчётом на экране, а превращается в конкретную задачу с исполнителем и датой повторной проверки.
На демо любого инструмента стоит спросить: что происходит после того, как отчёт показал пробел? Если ответ — "вы получаете PDF с рекомендациями" без интеграции в дальнейший процесс производства и публикации контента, у команды остаётся дополнительный ручной шаг между диагностикой и результатом, и именно на этом шаге чаще всего теряется темп.
Полезно попросить вендора показать полный путь одной конкретной находки от момента обнаружения до момента, когда она была закрыта: кто получил задачу, что именно изменилось на странице, и как быстро прошла повторная проверка. Если вендор может показать этот путь целиком на реальном примере, а не только описать его словами в презентации, это сильный сигнал, что цикл действительно работает на практике, а не существует только в маркетинговых материалах.
Раздел 07
Какие вопросы задать про технические правки, которые предлагает инструмент?
Спросите прямо: может ли инструмент вносить правки на сайт напрямую, и если да, требуется ли явное одобрение человека перед тем, как правка применится. Это принципиальный вопрос безопасности, а не техническая деталь.
В модуле технической оптимизации Humanswith.ai это устроено как двухшаговый процесс с жёсткой границей. Подготовка технического предложения сканирует ровно один заранее известный URL, без выгрузки сырого HTML наружу. Применение предложения происходит только после явного одобрения оператора, и на каждом шаге сохраняется привязка к проекту и запрет на прямую мутацию сайта в обход этого процесса. Похожая логика действует и для наблюдения за pull request и CI в репозитории: инструмент может классифицировать статус проверки, но зелёный CI сам по себе не даёт права на мерж или деплой — это осознанно оставлено человеку.
Если вендор на демо описывает технические правки формулировкой "инструмент сам всё исправит", стоит уточнить, что именно скрывается за словом "сам": предложение с обязательным одобрением или прямую мутацию сайта без возможности откатить или проверить перед применением.
- Спросить, требует ли применение технической правки явного одобрения человека.
- Уточнить границы одного предложения: весь сайт целиком или конкретная, заранее известная страница.
- Проверить, может ли инструмент автоматически мержить или деплоить код без участия человека.
- Попросить показать пример реального технического предложения от начала до применения.
Раздел 08
Кого стоит взять на демо, кроме маркетолога?
Демо инструмента ИИ-видимости почти всегда организует маркетинг, но решение купить или не купить не должно приниматься одним отделом в одиночку. Технический специалист на встрече быстро проверит, насколько реалистичны заявления про технические правки и интеграцию с существующим сайтом. Человек, отвечающий за бюджет, сразу сопоставит цену с реальным объёмом работы, который увидел на демо, а не с общим впечатлением от презентации.
Если в компании уже есть SEO-специалист, его стоит звать в первую очередь. Он лучше других распознает, когда демо показывает переименованный SEO-отчёт под новой вывеской, а когда реально другую методологию измерения. Отдел, который будет получать находки после покупки и превращать их в контент или технические задачи, тоже стоит включить в обсуждение до подписания контракта, а не знакомить с инструментом постфактум.
Раздел 09
Как оценить, соответствует ли цена объёму реальной работы?
Ценообразование стоит привязывать к охвату — количеству тем, промптов и движков, которые инструмент реально отслеживает и по которым выдаёт разбивку, а не к абстрактному "тарифу Pro". На демо стоит прямо спросить: сколько тем и промптов входит в предложенный тариф, и что произойдёт с ценой, если тем окажется больше, чем ожидалось на старте.
- Отдельно стоит уточнить, входит ли в цену только измерение, или ещё и производство контента с технической частью. Инструмент, который только показывает пробелы, но не помогает их закрыть, обычно стоит дешевле, но требует отдельного бюджета на исполнение находок в другом месте, и эту разницу лучше проговорить на демо, а не обнаружить в процессе использования.
- Уточнить точное число тем и промптов, включённых в выбранный тариф.
- Спросить, что происходит с ценой при расширении охвата в процессе работы.
- Разделить в голове цену за измерение и цену за производство контента и технических правок, если это разные модули.
- Сравнить цену не с "похожими" инструментами по названию, а с реальным объёмом охвата и частотой обновления данных.
Раздел 10
Как устроен русскоязычный рынок?
Для бизнеса с русскоязычной аудиторией отдельный вопрос — учитывается ли Яндекс Нейро и голосовой помощник Алиса наравне с ChatGPT и Perplexity, а не как второстепенное дополнение. Логика диагностики та же самая: доступ для краулеров, соответствие формата типу запроса, извлекаемость ответа, но набор систем для регулярной проверки для русскоязычного бизнеса должен обязательно включать локальные системы.
Если на демо русскоязычные системы не упомянуты вообще или добавлены отдельной платной опцией без реальной интеграции в общий цикл измерения, для компаний, работающих с русскоязычной аудиторией, это существенный пробел.
Стоит также уточнить, строится ли отчёт по русскоязычным движкам на тех же принципах, что и по остальным: раздельные упоминание и цитирование, разбивка по типу запроса, повторяемость измерения. Если для Яндекс Нейро и Алисы используется упрощённая версия методологии без этих разрезов, качество диагностики по русскоязычной аудитории окажется ниже, чем по остальным движкам, даже если сами системы формально присутствуют в списке поддерживаемых.
Раздел 11
Что должно насторожить на демо сразу?
- Один общий "AI Visibility Score" без разбивки на упоминание и цитирование. Это скрывает разницу между "бренд назвали" и "бренд процитировали как источник", а это две разные проблемы.
- Усреднённый показатель по всем ИИ-движкам сразу. ChatGPT, Perplexity, Google AI Overviews и Google AI Mode расходятся в выборе источников даже между собой, и общий процент маскирует, где именно проблема.
- Невозможность показать сырой список тестовых промптов. Если вендор не может открыть реальные формулировки, на которых строится отчёт, проверить методологию невозможно в принципе.
- Обещание прямой мутации сайта без approval-гейта. Технические правки без явного одобрения человека — риск, а не удобство.
- Отсутствие данных о вариативности между прогонами. Единственное число без указания на разброс между повторными измерениями с большой вероятностью показывает случайную точку, а не устойчивый тренд.
- Расплывчатый ответ про частоту обновления данных. "Регулярно" без конкретной цифры почти всегда означает "реже, чем хотелось бы клиенту".
- Нет отдельного трека для русскоязычных ИИ-систем, если аудитория бизнеса русскоязычная.
- Демонстрационные промпты работают, а свежие — нет. Инструмент, который справляется только с заранее подготовленным набором формулировок, вряд ли выдержит реальную повседневную нагрузку разнообразных запросов.
- Цена не привязана к конкретному охвату. Если тариф называется просто "Pro" или "Enterprise" без точного числа тем и промптов внутри, сравнить предложение с альтернативами или спрогнозировать рост цены будет нечем.
Раздел 12
FAQ
Q: Сколько промптов должно быть в базовом отчёте, чтобы ему можно было доверять?
A: Ориентир — 10–25 тем и по 10–25 промптов на тему, итого 100–250 формулировок. Меньше не даёт устойчивой картины, а сильно больше усложняет регулярное отслеживание без явного выигрыша в точности.
Q: Может ли инструмент с одним усреднённым показателем по всем движкам вообще быть полезен?
A: Как первое приближение — да, но для реальной работы над видимостью нужна разбивка по каждой системе отдельно, иначе непонятно, что именно чинить, когда общий показатель падает.
Q: Нужно ли требовать демо именно на данных своего бренда, а не на примере из презентации вендора?
A: Да, это самая полезная часть демо. Абстрактный пример на чужом бренде не покажет, как инструмент справляется с реальными формулировками именно вашей ниши и вашими конкурентами.
Q: Что если вендор не может показать вариативность между прогонами прямо на демо?
A: Это повод отнестись к итоговым цифрам осторожнее и попросить методологический документ отдельно, до подписания контракта, а не полагаться на устные заверения.
Q: Стоит ли выбирать инструмент только по числу поддерживаемых ИИ-движков?
A: Нет, число движков без прозрачной разбивки по каждому из них и без разделения упоминания и цитирования не решает проблему само по себе. Важнее качество измерения на каждом отдельном движке, чем просто их количество в маркетинговом списке.
Q: Как быстро можно оценить методологию инструмента на самом демо, не растягивая встречу?
A: Обычно достаточно трёх вопросов: сколько прогонов на промпт, разведены ли упоминание и цитирование, и требует ли применение технических правок одобрения человека. Ответы на них сразу показывают зрелость методологии.
Q: Может ли инструмент безопасно предлагать технические правки сайта без риска для продакшена?
A: Да, если предложение проверяется на одном заранее известном URL, не мутирует сайт напрямую и применяется только после явного одобрения человека — именно так устроен этот процесс в Website Agentic Optimization Humanswith.ai.
Q: Кого стоит звать на демо со стороны компании-покупателя?
A: Как минимум маркетолога, технического специалиста и человека, отвечающего за бюджет. Технический специалист проверит реалистичность заявлений про интеграцию и правки сайта, а ответственный за бюджет сразу сопоставит цену с реальным охватом, увиденным на демо.
Q: Стоит ли переходить с текущего инструмента, если он даёт только общий процент видимости без разбивки?
A: Стоит рассмотреть переход, если разбивка по движкам и разделение упоминания и цитирования важны для принятия решений о контенте. Общий процент подходит только для самого грубого первого ориентира, не для рабочего инструмента на постоянной основе.
Раздел 13
Что сделать сразу после демо
Сравните ответы нескольких вендоров по одному и тому же списку вопросов, а не по общему впечатлению от каждой отдельной презентации. Разница в готовности показать сырые данные, методологию агрегации и границы технических правок между вендорами обычно оказывается более информативной, чем разница в дизайне самого дашборда.
Раздел 14
Источники
- SparkToro (Rand Fishkin, Patrick O'Donnell / Gumshoe.ai). New Research: AIs Are Highly Inconsistent When Recommending Brands or Products, 28 января 2026. https://sparktoro.com/blog/new-research-ais-are-highly-inconsistent-when-recommending-brands-or-products-marketers-should-take-care-when-tracking-ai-visibility/
- Ahrefs (Despina Gavoyannis). AI Overviews vs AI Mode, 15 декабря 2025. https://ahrefs.com/blog/ai-overviews-vs-ai-mode/
Для вашей команды
Хватит нанимать агентства и фрилансеров
Нанимайте не агентства и фрилансеров — а Marketing AI-агентов под AI-поиск.
- Карта цитирований по 9 AI-движкам
- Контент и schema, которые зарабатывают цитирование
- Честный 30-минутный звонок до оплаты
Цитируемся в
- ChatGPT
- Claude
- Perplexity
- Gemini
- Grok
- DeepSeek
- Kimi
- Google AIO
- Copilot