Распространенная жалоба на Google Search Console (GSC) заключается в том, что данные «неточны» по сравнению с результатами Google Analytics.
Вы знаете ситуацию.
У всех нас есть.
Попробуйте сопоставить трафик с целевыми страницами из аналитики с помощью кликов из Google Search Console, и цифры не приблизятся!
Затем он бормочет что-то о «не предоставлено» и отправляет мгновенное сообщение другу о старых днях, когда он мог видеть ключевые слова в своих анализах.
Хотя это вопрос точность, Это не о точность как таковой.
Это несоответствие данных на самом деле задумано.
Давайте посмотрим на детали и выясним, почему это так.
Консоль поиска Google и Google Analytics не измеряют одно и то же

Краткое объяснение состоит в том, что два источника данных имеют разные методологии измерения.
GSC построен из журналов запросов и кликов, или выбора, поэтому данные будут примерно такими же, как вы могли бы ожидать от ваших собственных файлов журналов доступа (вы знаете, файлов, которые он запрашивает у DevOps для доступа). для анализа файла журнала).
Скорее, его аналитический пакет собирает данные из Clickstream через JavaScript. Это по своей сути вводит много переменных в как вещи могут быть измерены, а также какие эти вещи
Чтобы лучше понять, что вызывает различия в данных между GSC и аналитикой, вы должны сначала понять, как каждый инструмент собирает и понимает данные о поведении пользователей.
Анатомия консультации и отбор записей (клик)
Непрерывный поиск Google для качества поиска заставляет их сканировать большое количество точек данных для каждого поиска и каждой поисковой системы, надеясь получить полное понимание того, что происходит в поисковой выдаче.

Хотя они много раз заявляли, что не позволяют кликам и коэффициентам кликов влиять на рейтинг, несмотря на свидетельства обратного, они также говорят, что используют данные о кликах для оценки эффективности.

Это был один из постоянных споров между Google, стоящими перед публикой, и SEO.
Лично я считаю, что сторона Google – это семантический аргумент.
Существует несколько мер оценки, которые являются стандартными для поиска информации, такие как:
- щелчки
- Отказ от поисковой выдачи.
- Успешность сеанса.
- И т.п.
Как вы можете себе представить, у Google есть своя разновидность, называемая моделью щелчка, внимания и удовлетворенности (прочитайте объяснение Билла Славски, если вам нужен перевод).
Это обсуждается в документе под названием «Внедрение кликов, внимания и удовлетворенности в модель оценки страницы результатов поисковой системы» в сочетании с методологией на основе кликов, выделенной в патенте на основе классификации по времени, и предполагает, что кто-то по крайней мере, он нашел время подумать о том, как клики могут повлиять на рейтинг.
Согласно показаниям Эрика Шмидта в 2011 году, Google провела «13111 точных оценок». Это было бы в среднем ~ 35 в день.
Таким образом, само собой разумеется, что если вы всегда оцениваете в производственной среде, такой как команда поиска, то всегда есть вероятность, что клики пользователей повлияют на рейтинг.
И еще есть этот раздел Классификации результатов поиска статистики изменения статистики поиска в корпусе, в котором говорится о записях поиска и о том, как они могут сообщать рейтинги в будущем:
«Информация, хранящаяся в журналах сеансов 2060 или в журналах поиска они могут быть использованы модификатором диапазона 2070 при генерации одного или нескольких сигналов для механизма ранжирования 2030, В общем, широкий спектр информации может быть собран и использован для изменения или настройки сигнала пользователя, чтобы сделать это, и будущие результаты поиска лучше приспособлены к потребностям пользователя. Следовательно, выбор пользователей из одного или нескольких корпусов для проведения поисков и взаимодействия пользователей с результатами поиска, представленными пользователям информационно-поисковой системы, можно использовать для повышения рейтинга в будущем ».
Тем не менее, наиболее интересной является концепция, что эти регистры создают много шума в дополнение к своим наиболее ценным сигналам.
Это говорит о том, что совершать клики полностью по письму было бы ошибкой.

О каком шуме идет речь?
Ну, например, сколько показов представляют инструменты ранжирования?
Сколько раз вы нажимаете ввод на autosuggest, а затем понимаете, что он вызывает поиск «поклонник» вместо «фантастической 4»?
Или, что происходит, когда вы прокручиваете на своем мобильном телефоне и случайно большой палец неверный результат?
Все это примеры того, как данные, которые собирает Google, могут представлять большое количество неточностей и должны их учитывать.
Спасибо, что позволили мне отложить это в сторону.
Хорошо, так что в файлах журнала?
Если отсутствующая в настоящее время документация Google Search Appliance является указанием (а может и не быть), журналы запросов и кликов – это просто текстовые файлы, в которых записываются данные о пользователях и их взаимодействиях с SERP.
В документации обсуждаются записи поиска, которые могут совпадать или не совпадать с записями запросов и кликов, как указано в патентах Google.
Несмотря на то, что это упрощенная версия системы, она дает нам представление о том, что отслеживается: характеристики пользователя, его запросы и характеристики того, на что они нажимают.
Углубившись в системы и методы Google для генерации статистики из патентов записей запросов поисковых систем, они немного больше рассказывают о том, как может работать система, которая может использовать такой инструмент, как Google Trends.
Для этого обсуждения я предполагаю, что базовый набор данных похож, если не совпадает с тем, что используют консоль поиска Google и фид Планировщика ключевых слов Google Ads.
Они обсуждают записи запросов следующим образом:
«Поисковая система может получать миллионы запросов в день от пользователей по всему миру. Для каждого запроса поисковая система генерирует запись запроса в своем журнале запросов. Журнал запросов может включать одно или несколько условий запрос, отметка времени, указывающая, когда запрос принимается поисковой системой, IP-адрес, который идентифицирует уникальное устройство (например, ПК или сотовый телефон), с которого отправляются условия запроса, и идентификатор, связанный с пользователем, отправляющим условия запроса (например, идентификатор пользователя в файле cookie веб-браузера). "
Другими словами, журналы поисковых запросов представляют собой несколько более надежную версию журналов поиска GSA.
Авторы объясняют более подробно немного позже в патенте с обсуждением того, как куки, устройства, язык пользователя и местоположение также отслеживаются.
Они также предоставляют следующий рисунок для визуального представления данных, собранных в журнале запросов:

Придавая системе больше цвета, патент обсуждает эту концепцию записи сеанса, которая является механизмом для определения, выполнил ли данный пользователь такие же или аналогичные поиски в течение данного периода времени.
Это особенно важно, когда дело доходит до измерения и составления отчетов о результатах поиска и / или объеме:
«Запись сеанса консультации включает в себя запросы, широко разнесенные во времени и / или запросы, связанные с интересами пользователя. В некоторых вариантах осуществления процесс извлечения сеанса запроса основан на эвристике. Например, последовательные запросы принадлежат одному и тому же сеансу, если они совместно используют некоторые условия запроса или если они отправляются в течение заранее определенного периода времени (например, десять минут), даже если между ними нет общего условия запроса ".
Приведенная выше эвристика, возможно, является основной причиной того, что Search Console и ее аналитический пакет никогда не будут совпадать.
По сути, автор говорит, что Google принимает решение в своем журнале запросов определить, достаточно ли уникальны поисковые запросы в его сеансе, чтобы регистрироваться как отдельные.
Так что вы можете поверить, что это два разных посещения вашего сайта, потому что они происходят из двух разных поисков, которые попали на две разные целевые страницы потенциально может он будет считаться поиском и, следовательно, показом, в зависимости от того, как он записан в журналах запросов Google.

Записи кликов, с другой стороны, предоставляют больше информации о поведении пользователей, когда они представлены серией результатов.
Классификация результатов поиска модификаций, основанная на патенте статистики поиска в корпусе, показывает, что может храниться в этом наборе данных (выделено мной):
«Записанная информация, включая информацию о выборе результата, может быть сохранена в журналах сеансов 2060, В некоторых реализациях данные поиска и информация о выборе результатов хранятся в записях поиска. В некоторых реализациях регистрируемая информация включает в себя записи журнала, указывающие, fили каждый выбор пользователя, запрос (Q), документ (D), время (T) между двумя последовательными выборами результатов поиска, язык (L), используемый пользователем, и страна (C), где пользователь, вероятно, находится (например, в зависимости от сервера, используемого для доступа к ИК-системе). В некоторых реализациях другая информация о взаимодействиях пользователей также регистрируется с представленным рейтингом., включая негативную информацию, такую как факт, что результат документа был представлен пользователю, но не нажал, позиции щелчка в пользовательском интерфейсе, IR оценки результатов клика, IR оценки все результаты, отображаемые до результата нажатия, заголовки и фрагменты, которые отображаются пользователю до результата щелчка, cookie пользователя, возраст cookie, IP-адрес, агент пользователя браузера, и т.п., Вы можете записать еще больше информации, например, результаты поиска, возвращаемые по запросу, где результаты поиска – это элементы контента, разделенные на один или несколько корпусов. В некоторых реализациях аналогичная информация (например, оценки IR, положение и т. Д.) Записывается для всего сеанса или нескольких сеансов пользователя. В некоторых реализациях регистрация подобной информации не связана с пользовательскими сеансами. В некоторых реализациях такая информация записывается для каждого клика, который происходит до и после текущего клика. "
Хотя консоль поиска Google отображает только часть этой информации, совершенно очевидно, что инструмент Search Analytics фактически представляет собой ограниченный пользовательский интерфейс, построенный поверх этого набора данных.
Здесь интересно упомянуть действия, которые могут происходить в поисковой выдаче.
Это указывает на то, что отслеживается не только каждый клик, но и характеристики, определяющие положение результата в результатах поиска.
Что определяет клик?

В общедоступной документации для Google Search Appliance не указано, что считается кликом или показом.
Например, если я ищу ключевое слово и нажимаю на результат, возвращаюсь и снова нажимаю на тот же результат, учитывает ли Google эти два разных клика или один?
Однако системы и методы для генерации статистики из патентов записей поисковых запросов дают представление об ответе на этот вопрос.
Первое, что нужно знать, это то, что они часто выбирают данные. Это имеет смысл в среде Google Trends.
Тем не менее, автор отмечает, что существуют случаи использования, когда данные не могут быть отобраны.
"Чтобы получить достоверную статистическую информацию из записи 108 запроса, не всегда необходимо просматривать все записи запроса. (также называемые журналами журналов или журналами транзакций) в журнале запросов. Пока статистическая информация извлекается из достаточного количества выборок в записи запроса, информация столь же надежна, как и информация, полученная из всех записей. Кроме того, требуется меньше времени и вычислительных ресурсов для просмотра записи запроса с субдискретизацией. Следовательно, процесс 110 выборки записи запроса может использоваться для выборочной записи 108 запроса и создания записи 112 запроса с субдискретизацией. Например, запись 112 запроса с субдискретизацией может содержать десять или двадцать процентов записи записей в исходной записи запроса 108. Обратите внимание, что процесс выборки является необязательным. В некоторых вариантах осуществления вся запись 108 запроса используется для генерации статистической информации."
Google также, кажется, глубоко считает, что два запроса аналогичных запросов могут представлять собой поиск.
Эта линия мышления является центральным компонентом, который производит разницу в измерениях между инструментами.
Поскольку в последнее время Google перешел к тому, чтобы предоставлять к единственному и множественному числу ключевых слов одинаковый объем поиска, к огорчению поискового сообщества, очень важно увидеть взгляд изнутри на этот вопрос.
Я представил его обсуждение патента во всей его полноте ниже (выделение мое):
«Например, пользователь может сначала отправить запрос« Французский ресторан, Пало-Альто, Калифорния »в поисках информации о французских ресторанах в Пало-Альто, Калифорния. Впоследствии тот же пользователь может отправить новый запрос» Итальянский ресторан, Пало-Альто , CA ", ищет информацию об итальянских ресторанах в Пало-Альто, штат Калифорния. Эти два запроса логически связаны, так как оба относятся к поиску ресторанов в Пало-Альто, штат Калифорния. Эти отношения могут быть продемонстрированы тем фактом, что два запроса отправляются вовремя или эти два имеют общие термины запроса (например, «restaurant» и «Palo Alto») ».
«(0035) В некоторых вариантах осуществления эти связанные запросы группируются в сеанс запросов, чтобы более точно характеризовать поисковые операции пользователя. Сеанс запроса состоит из одного или нескольких однопользовательских запросов, включая все запросы, отправленные за короткий период времени (например, десять минут), или последовательность запросов с перекрывающимися или общими условиями запроса, которые могут быть расширены. в течение более длительного периода времени (например, запросы, отправленные одним пользователем на срок до двух часов). Запросы, которые относятся к разным темам или интересам, назначаются разным сеансам, если только запросы не отправляются в очень тесной последовательности и не назначаются сеансу, который включает в себя другие подобные запросы. Тот же пользователь, который ищет рестораны в Пало-Альто, может позже отправить запрос «iPod Video» для получения информации о новом продукте, произведенном Apple Computer. Этот новый запрос связан с другим интересом или темой, нежели рестораны Пало-Альто, и, следовательно, не группируется в том же сеансе, что и запросы, связанные с рестораном. Следовательно, запросы одного пользователя могут быть связаны с несколькими сеансами. Два сеанса, связанные с одним и тем же пользователем, будут использовать один и тот же файл cookie, но будут иметь разные идентификаторы сеанса ».
Достаточно сказать, что реестр в поисковой системе Google использует определенный набор методологий, чтобы определить, что такое другой поиск и другой клик.
Это может совпадать или не совпадать с тем, что вы создаете, или с тем, как настроена ваша аналитическая платформа, чтобы считать, что это сеанс.
Как Analytics определяет сеанс

Пакеты анализа, с другой стороны, также следуют ряду методов для измерения пользователя и его активности.
В зависимости от пакета анализа пользователь может определить «сеанс» или посещение.
Согласно документации Google Analytics, «по умолчанию сеанс длится до 30 минут бездействия, но вы можете настроить этот предел так, чтобы сеанс длился от нескольких секунд до нескольких часов».
Поэтому, хотя мы не знаем точного времени, которое Google Search рассматривает как сеанс, числа, рассмотренные в приведенных выше выдержках, безусловно, не превышают 30 минут.
В патенте, связанном с Google Analytics, Системой и способом добавления аналитических данных, авторы рассказывают о том, как пользователь отслеживается по идентификатору сеанса и как этот механизм может быть признан недействительным:
«Идентификатор сеанса обычно присваивается посетителю при первом посещении сайта. Он отличается от идентификатора пользователя тем, что сеансы обычно недолговечны (срок их действия истекает после заранее определенного времени бездействия, которое может составлять минуты или часы). ) и может стать недействительным после достижения определенной цели (например, после того, как покупатель завершил свой заказ, он не может использовать один и тот же идентификатор сеанса для добавления других товаров ».
В результате пользователь может потенциально измеряться несколько раз за одно посещение.
Пакеты анализа представляют собой сложные среды, которые допускают различные уровни специфичности в вашей конфигурации.
Существует множество причин, по которым вы не увидите согласованности между двумя пакетами аналитики, не говоря уже о двух инструментах, которые измеряют разные вещи.
Почему два не совпадают
Проще говоря, клик консоли поиска Google не является сеансом Google Analytics, а сеанс Google Analytics не является кликом консоли поиска Google.
В приведенном выше сценарии, когда пользователь щелкнул дважды, это можно считать двумя щелчками мыши и одним сеансом.

В качестве альтернативы, если пользователь должен выполнить два разных поиска и сделать два разных клика, его активность можно считать печатью и кликом, но это также может сделать недействительным его идентификатор сеанса или тайм-аут в некоторый момент и рассматриваться как два разных посещения в аналитике.
Или подумайте об этом:
Пользователь нажимает на свой результат, но его анализ не был инициирован по различным причинам. Это говорит о любой из нескольких причин, почему анализ не всегда является самым надежным источником правды.
Наконец, GSC использует канонические URL-адреса, а аналитика может использовать любой URL-адрес для отчета о сеансе. Google немного говорит об этом в своей документации.
Однако их обсуждение больше связано с объяснением различий в контексте интеграции GSC с GA, а не с объяснением различий в методологиях измерений.

Почему это проблема?
Основная проблема заключается в том, что многие маркетологи не верят в данные GSC, потому что считают аналитику своим основным источником правды.
Игнорируя, что вся аналитика изначально несовершенна, я полагаю, что паритет между источниками нереален, и мы видим две стороны одной и той же истины, только измеряемые по-разному.
Данные о производительности консоли поиска Google являются показателем того, что происходит в Google, а не обязательно того, что происходит на вашем сайте.
Да, и как мы это делаем, не забывайте, что данные о местоположении GSC измеряют что-то отличное от данных ранжирования.
Как получить более точные данные
Точность данных, представляемых в консоли поиска Google, на самом деле возрастает по мере того, как вы вводите более подробную информацию о том, как вы просматриваете веб-сайт.
Другими словами, если вы создаете профили, которые отражают более глубокие уровни структуры каталогов, инструмент генерирует больше данных.
Добавление 10 или сотен подкаталогов в вашу консоль поиска Google может быть довольно утомительным, но повышение точности данных может быть весьма полезным для таких случаев использования, как A / B-тестирование и понимание возможностей использования ключевых слов.

При добавлении большого количества профилей необходимо учитывать ключевое ограничение: пользовательский интерфейс GSC ограничивает его до 1000 запросов на фильтр поиска.
Поэтому вам следует рассмотреть возможность использования API для извлечения ваших данных, так как он возвращает 5000 для фильтра поиска.
Кроме того, чтобы извлечь как можно больше данных, вы должны рассмотреть возможность выполнения серии попыток в качестве поисковых фильтров (S / O для William Sears).
Это гарантирует, что вы используете как можно больше поднаборов слов в качестве фильтров, чтобы получить как можно больше результатов.
Выполнение этого с помощью подкаталога и следование таксономии вашего сайта позволит вам получить максимально точные данные.
Ничто не было прежним

С момента дебюта «(не предоставлено)» в конце 2011 года мы знали, что наши обычные поисковые данные будут разрушены.
Реально, мы никогда не будем жить в мире, где мы уже можем связать посещение непосредственно с сеансом.
Данные, предоставленные Google Search Console, являются лучшими, что у нас будет в будущем.
Хотя данные не будут соответствовать их истинному источнику, это не означает, что они неточны.
Точно так же, как вы не должны ждать Facebook Данные объявлений, соответствующие Google Analytics, или файлы журналов в Kibana, совпадающие с данными Adobe Analytics, не следует ожидать, что Google Search Console будет соответствовать вашим данным аналитики.
А теперь иди и будь великолепным.
Изображения в посте: Создано автором, март 2020
Все скриншоты, сделанные автором, март 2020
