Главная > Мастер-классы > Теоретические основы текстового ранжирования в Яндексе (Часть 2. Текстовое ранжирование)

Теоретические основы текстового ранжирования в Яндексе (Часть 2. Текстовое ранжирование)

29 Июня 2007 года, 12:00

Шрифт:

0 14918

1. Введение
2. Основная часть
3. Рекомендации по оптимизации текста
4. Заключение

1. Введение

В предыдущей части мастер-класса мы познакомились с основами текстового ранжирования, а точнее с той частью, которая происходит непосредственно перед оценкой текстового веса документа.

Теперь рассмотрим основные текстовые факторы, влияющие на релевантность документа.

2. Основная часть

Итак, начнем с основ информационного поиска – формулы TF*IDF.

TF-IDF (от англ. TF — term frequency, IDF — inverse document frequency) — статистическая мера, используемая для оценки важности слова в контексте документа, являющегося частью коллекции документов или корпуса. Вес некоторого слова пропорционален количеству употребления этого слова в документе, и обратно пропорционален частоте употребления слова в других документах коллекции.

TF (term frequency — частота слова) — отношение числа вхождения некоторого слова к общему количеству слов документа. Таким образом, оценивается важность слова ti в пределах отдельного документа:

где ni есть число рассматриваемых употреблений слова, а в знаменателе общее число словоупотреблений.

IDF (inverse document frequency — обратная частота документа) — инверсия частоты, с которой некоторое слово встречается в документах коллекции. Таким образом, понижается вес широкоиспользуемых слов.

где D — количество документов в корпусе;

- количество документов, в которых встречается ti, когда

Конечно же, Яндекс для оценки релевантности документа использует видоизмененную формулу. Сделаем сразу оговорку, что у нас речь пойдет об относительной релевантности, т.е. релевантности нескольких документов одному запросу, таким образом, величина IDF просто-напросто сократится при расчетах.

В общем виде формула имеет вид:

т.е. текстовая релевантность (W) рассчитывается как отношение количества найденных ключевых слов к «тошноте». «Тошнота» рассчитывается как квадратный корень из частоты самого часто встречаемого слова в документе.

Если ЧСЧВС меньше семи, то тогда:

Если «тошнота» превышает некий порог (для различных слов он различен, но примерно это интервал от 20 до 25), то Яндекс начинает искусственно занижать вес документа.

Почему «тошнота»? Это определение ввел в речевой обиход оптимизаторов Миныч, после этого определение так и прижилось.

Итак, из формулы мы видим, что в Яндексе нет такого понятия как «плотность ключевого слова», т.е. объем всего текста не учитывается. Это подтверждает эксперимент «Зависимость релевантности страницы от количества нерелевантных пассажей».

При расчете «тошноты» документа учитываются и стоп-слова. (См. эксперимент «Учет стоп-слов при расчете тошноты»).

Уточним далее формулу.

Не все ключевые слова вносят свой вклад в релевантность документа, а только те, которые попали в релевантные пассажи. Если запрос однословный, т.е. ключевой слово одно, то тогда любой пассаж, содержащий это слово, будет релевантным. Если у нас - ключевая фраза из нескольких слов, то при расчете релевантности будут учитываться только те пассажи, которые прошли кворум.

При этом если в одном пассаже ключевое слово будет повторять несколько раз (более 4), то это негативно отразиться на релевантности документа.

Углубляемся дальше. Пассаж пассажу рознь. Во-первых, пассаж может принадлежать различным зонам документа:

o title
o description
o keywords
o body

Во-вторых, пассаж, относящийся к body, может иметь различное форматирование – например, пассаж может быть заголовком < h1>. Также пассаж может быть включен в теги < script>, < noindex> - в этом случае пассаж проиндексирован не будет.

На seonews.ru уже публиковалось несколько экспериментов, посвященных изучению влияния принадлежности пассажа к определенной зоне документа. В результате были сделаны следующие выводы:

1. Description и keywords сайта не влияют на релевантность. При этом keywords вообще не индексируется.
2. Заголовки < h1>…< h6> немного повышают релевантность документа.
3. Title влияет на релевантность (Однако надо помнить, что из title индексируется только 15 первых слов!).

Кроме учета принадлежности пассажа, также учитывается е еще несколько факторов.

Расхожее мнение о том, что на релевантность влияет форматирование ключевых словом при помощи тегов , , и т.д. сейчас уже неактуально. Все это осталось в прошлом.

Гораздо важнее точность вхождения ключевой фразы в документ – точность с точки зрения морфологии и точность с точки зрения словопозиций.

В подтверждении несколько примеров.

Сделаем запрос «Ухта». Получим следующую выдачу:

Теперь изменим окончание и зададим запрос «Ухту». Мы видим и изменение в выдаче. На первом месте появился сайт, который имеет точное совпадение с запросом.

Аналогично можно поэкспериментировать со словопозициями.

Например, для запросов «Майкл Джаггер» и «Майкл &/(-1 5) Джаггер» выдача будет отличаться. Напомним, что конструкция «Майкл &/(-1 5) Джаггер» означает, что слово Джаггер должно находиться в районе 1 слова слева или 5 слов справа от слова «Майкл».

Оптимальной позицией слова «Джаггер» относительно слова «Майкл» будет позиция через одно слов справа, т.к. (5+(-1))/2=2. Эта формула для расчета оптимальной позиции в свое время тоже была предложена Минычем.

3. Рекомендации по оптимизации текста

Конечно, количественный расчет текстовой релевантности дело интересное и нужное, но для практических целей вполне подойдет ряд рекомендаций, соблюдая которые, вы напишете хороший (с т.зр. Яндекса) контент для сайта.

Главный принцип, которому нужно следовать – естественность текста. Не надо перегружать содержимое сайта ключевыми словами, тегами форматирования и прочим. Все должно быть в меру.

1. Прежде всего, уменьшите «тошноту» продвигаемой страницы.
2. Пишите релевантный title, не употребляя ни одного слова более одного раза.
3. Пишите description таким образом, чтобы если вдруг это описание попало в сниппет, оно привлекло пользователя, а не наоборот, оттолкнуло набором ключевых фраз.
4. Используйте заголовки ради удобства пользователя, а не для поисковой системы, которая на них не обращает внимания.
5. Используйте хотя бы одно точное вхождение (и с точки зрения морфологии и с точки зрения словопозиций) ключевой фразы.

4. Заключение

Итак, мы рассмотрели основные факторы, влияющие на текстовую релевантность.

Все факторы были проверены путем экспериментов. На настоящий момент информация является актуальной, но периодически Яндекс вносит изменения в алгоритм, так что нужно постоянно перепроверять действие выше озвученных факторов.

Конечно, сейчас основное значение придается ссылочному ранжированию, основные усилия направлены на покупку ссылок, оценку площадок, изучение правил составления текстов ссылок… Но про текст тоже не нужно забывать, т.к. сайт с правильно написанным контентом легче и, главное, дешевле продвинуть в топ.

Статьи: Читайте также

SEO глазами клиентов 2026: участники об итогах исследования и изменениях в отрасли. Часть 1

Логические тесты при приеме на работу: лучшие онлайн-тренажеры с ответами и примеры заданий

Как я проверил SEO-статью, которую написал мой ИИ: 5 ошибок, которые стоят клиентам денег

Как ChatGPT выбирает компании для рекомендаций: что уже известно и как бизнесу подготовиться к эпохе AI Search

Есть о чем рассказать? Тогда присылайте свои материалы Марине Ибушевой

Комментарии (0)

Добавить комментарий

Сообщество

Отправить отзыв

ПОПУЛЯРНЫЕ ОБСУЖДЕНИЯ НА SEONEWS

Как ChatGPT выбирает компании для рекомендаций: что уже известно и как бизнесу подготовиться к эпохе AI Search

2 комментария

5 дней назад

Сергей Семенов

1
комментарий

0
читателей

Полный профиль

Сергей Семенов - Спасибо за вопрос. Нет, полностью автоматически отчёт не генерируется. Мы сознательно не пошли по пути «нажал кнопку — получил PDF». В RECOMO мы используем ИИ как инструмент анализа, а не как замену методологии. Наш процесс состоит из нескольких этапов: Проводится серия проверок в различных AI-системах (ChatGPT, Gemini, Claude и других) по заранее сформированной методике и набору запросов. Собираются данные о том, какие компании рекомендуются, в каком контексте, какие источники используются и какие цифровые сигналы присутствуют. Далее ИИ помогает структурировать и анализировать большой объём информации, выявлять закономерности и формировать черновики выводов. После этого отчёт обязательно проходит экспертную проверку нашей командой. Мы дополняем его интерпретацией результатов, практическими рекомендациями и проверяем, чтобы выводы действительно соответствовали данным. Пока рынок AI Search только формируется, полностью доверять генерацию подобных аудитов одной языковой модели было бы неправильно. Именно поэтому мы сочетаем собственную методологию, автоматизированный сбор и анализ данных и экспертную валидацию результатов. Наша цель — не просто красиво оформить отчёт, а дать бизнесу рекомендации, которые действительно помогут повысить AI Visibility и увеличить вероятность появления бренда в рекомендациях современных AI-систем.

Накрутка ПФ vs Бизнес: как накрутка поведенческих факторов «убьет» ваш бизнес в интернете

2 комментария

4 месяца назад

Гость

1
комментарий

0
читателей

Полный профиль

Гость - Вообще бред несут-пункт позиции и там и там суотрудничать,банов нет,риски и остальные пункты просто смешно,пф гораздо эффективнее чем платить в пиксель)))

Мы сократили рутину SEO-специалиста на 95% – вот архитектура, которая это сделала

2 комментария

3 месяца назад

Гостьkorayaskin

2
комментария

0
читателей

Полный профиль

Гостьkorayaskin - Можно также посмотреть разбор инструментов типа KeywordKick — помогает быстрее понять, где именно конфликт сигналов.

GEO-продвижение: гайд повышения видимости бренда (сайта) в нейросетях

2 комментария

2 месяца назад

dayitrix

3
комментария

0
читателей

Полный профиль

dayitrix - Спасибо за разбор. Сейчас как раз в процессе изучения GEO-продвижения, хочется разобраться, как вообще попадать в ответы нейросетей. Ну и смотрю, уже услуги по такому продвижению начали появляться, типа Zenlink Geo. Но пока по большей части информацию собираем, что это и стоит ли в это лезть. Но учитывая то, что люди сейчас в основном через нейронной информацию ищут, было б неплохо, чтоб нейросети нас упоминали)

Сайт компании в 2026 году: что проверяет Роскомнадзор и как не получить штраф

1 комментарий

5 дней назад