×
Россия +7 (495) 139-20-33

Теоретические основы текстового ранжирования в Яндексе (Часть 2. Текстовое ранжирование)

Россия +7 (495) 139-20-33
Шрифт:
0 12134

1. Введение
2. Основная часть
3. Рекомендации по оптимизации текста
4. Заключение

1. Введение

В предыдущей части мастер-класса мы познакомились с основами текстового ранжирования, а точнее с той частью, которая происходит непосредственно перед оценкой текстового веса документа.

Теперь рассмотрим основные текстовые факторы, влияющие на релевантность документа.

2. Основная часть

Итак, начнем с основ информационного поиска – формулы TF*IDF.

TF-IDF (от англ. TF — term frequency, IDF — inverse document frequency) — статистическая мера, используемая для оценки важности слова в контексте документа, являющегося частью коллекции документов или корпуса. Вес некоторого слова пропорционален количеству употребления этого слова в документе, и обратно пропорционален частоте употребления слова в других документах коллекции.

TF (term frequency — частота слова) — отношение числа вхождения некоторого слова к общему количеству слов документа. Таким образом, оценивается важность слова ti в пределах отдельного документа:



где ni есть число рассматриваемых употреблений слова, а в знаменателе общее число словоупотреблений.

IDF (inverse document frequency — обратная частота документа) — инверсия частоты, с которой некоторое слово встречается в документах коллекции. Таким образом, понижается вес широкоиспользуемых слов.



где D — количество документов в корпусе;

- количество документов, в которых встречается ti, когда



Конечно же, Яндекс для оценки релевантности документа использует видоизмененную формулу. Сделаем сразу оговорку, что у нас речь пойдет об относительной релевантности, т.е. релевантности нескольких документов одному запросу, таким образом, величина IDF просто-напросто сократится при расчетах.

В общем виде формула имеет вид:



т.е. текстовая релевантность (W) рассчитывается как отношение количества найденных ключевых слов к «тошноте». «Тошнота» рассчитывается как квадратный корень из частоты самого часто встречаемого слова в документе.



Если ЧСЧВС меньше семи, то тогда:



Если «тошнота» превышает некий порог (для различных слов он различен, но примерно это интервал от 20 до 25), то Яндекс начинает искусственно занижать вес документа.

Почему «тошнота»? Это определение ввел в речевой обиход оптимизаторов Миныч, после этого определение так и прижилось.

Итак, из формулы мы видим, что в Яндексе нет такого понятия как «плотность ключевого слова», т.е. объем всего текста не учитывается. Это подтверждает эксперимент «Зависимость релевантности страницы от количества нерелевантных пассажей».

При расчете «тошноты» документа учитываются и стоп-слова. (См. эксперимент «Учет стоп-слов при расчете тошноты»).

Уточним далее формулу.

Не все ключевые слова вносят свой вклад в релевантность документа, а только те, которые попали в релевантные пассажи. Если запрос однословный, т.е. ключевой слово одно, то тогда любой пассаж, содержащий это слово, будет релевантным. Если у нас - ключевая фраза из нескольких слов, то при расчете релевантности будут учитываться только те пассажи, которые прошли кворум.

При этом если в одном пассаже ключевое слово будет повторять несколько раз (более 4), то это негативно отразиться на релевантности документа.

Углубляемся дальше. Пассаж пассажу рознь. Во-первых, пассаж может принадлежать различным зонам документа:

o title
o description
o keywords
o body

Во-вторых, пассаж, относящийся к body, может иметь различное форматирование – например, пассаж может быть заголовком < h1>. Также пассаж может быть включен в теги < script>, < noindex> - в этом случае пассаж проиндексирован не будет.

На seonews.ru уже публиковалось несколько экспериментов, посвященных изучению влияния принадлежности пассажа к определенной зоне документа. В результате были сделаны следующие выводы:

1. Description и keywords сайта не влияют на релевантность. При этом keywords вообще не индексируется.
2. Заголовки < h1>…< h6> немного повышают релевантность документа.
3. Title влияет на релевантность (Однако надо помнить, что из title индексируется только 15 первых слов!).

Кроме учета принадлежности пассажа, также учитывается е еще несколько факторов.

Расхожее мнение о том, что на релевантность влияет форматирование ключевых словом при помощи тегов , , и т.д. сейчас уже неактуально. Все это осталось в прошлом.

Гораздо важнее точность вхождения ключевой фразы в документ – точность с точки зрения морфологии и точность с точки зрения словопозиций.

В подтверждении несколько примеров.

Сделаем запрос «Ухта». Получим следующую выдачу:



Теперь изменим окончание и зададим запрос «Ухту». Мы видим и изменение в выдаче. На первом месте появился сайт, который имеет точное совпадение с запросом.



Аналогично можно поэкспериментировать со словопозициями.

Например, для запросов «Майкл Джаггер» и «Майкл &/(-1 5) Джаггер» выдача будет отличаться. Напомним, что конструкция «Майкл &/(-1 5) Джаггер» означает, что слово Джаггер должно находиться в районе 1 слова слева или 5 слов справа от слова «Майкл».

Оптимальной позицией слова «Джаггер» относительно слова «Майкл» будет позиция через одно слов справа, т.к. (5+(-1))/2=2. Эта формула для расчета оптимальной позиции в свое время тоже была предложена Минычем.

3. Рекомендации по оптимизации текста

Конечно, количественный расчет текстовой релевантности дело интересное и нужное, но для практических целей вполне подойдет ряд рекомендаций, соблюдая которые, вы напишете хороший (с т.зр. Яндекса) контент для сайта.

Главный принцип, которому нужно следовать – естественность текста. Не надо перегружать содержимое сайта ключевыми словами, тегами форматирования и прочим. Все должно быть в меру.

1. Прежде всего, уменьшите «тошноту» продвигаемой страницы.
2. Пишите релевантный title, не употребляя ни одного слова более одного раза.
3. Пишите description таким образом, чтобы если вдруг это описание попало в сниппет, оно привлекло пользователя, а не наоборот, оттолкнуло набором ключевых фраз.
4. Используйте заголовки ради удобства пользователя, а не для поисковой системы, которая на них не обращает внимания.
5. Используйте хотя бы одно точное вхождение (и с точки зрения морфологии и с точки зрения словопозиций) ключевой фразы.

4. Заключение

Итак, мы рассмотрели основные факторы, влияющие на текстовую релевантность.

Все факторы были проверены путем экспериментов. На настоящий момент информация является актуальной, но периодически Яндекс вносит изменения в алгоритм, так что нужно постоянно перепроверять действие выше озвученных факторов.

Конечно, сейчас основное значение придается ссылочному ранжированию, основные усилия направлены на покупку ссылок, оценку площадок, изучение правил составления текстов ссылок… Но про текст тоже не нужно забывать, т.к. сайт с правильно написанным контентом легче и, главное, дешевле продвинуть в топ.

(Голосов: 5, Рейтинг: 5)
Читайте нас в Telegram - digital_bar

Есть о чем рассказать? Тогда присылайте свои материалы Марине Ибушевой


Новые 
Новые
Лучшие
Старые
Сообщество
Подписаться 
Подписаться на дискуссию:
E-mail:
ОК
Вы подписаны на комментарии
Ошибка. Пожалуйста, попробуйте ещё раз.
Отправить отзыв
ПОПУЛЯРНЫЕ ОБСУЖДЕНИЯ НА SEONEWS
Алгоритм продвижения сайта через Pinterest
Виктор Гаврюков
29
комментариев
1
читатель
Полный профиль
Виктор Гаврюков - В самом вверху есть ссылка на мою группу в ВК, там где автор материала. Через группу и свяжитесь со мной_)
Ссылочный апдейт Google: что изменится для SEO-специалистов в рунете
Тимур
6
комментариев
0
читателей
Полный профиль
Тимур - Понял, спасибо за информацию.
Как забрать 5 мест в выдаче из 10. Кейс-эксперимент
Виктор Гаврюков
29
комментариев
1
читатель
Полный профиль
Виктор Гаврюков - такое можно делать и с ВЧ_)
3 основные ошибки, которые допускают владельцы сайтов при продвижении
Виктор Гаврюков
29
комментариев
1
читатель
Полный профиль
Виктор Гаврюков - Не обращай внимания_) Если у тебя хороший ресурс, то ты будешь первоисточником, и все кто своровал, автоматически начнут на тебя ссылаться, точнее, так гугл будет считать_)
Как продвинуть сайт по коммерческим запросам в ТОП-10 с помощью ресурса Reddit
Denis Zar
2
комментария
0
читателей
Полный профиль
Denis Zar - пользовались услугами по продвижению на реддит от reddit-marketing.pro?
Как мы увеличили трафик из Яндекса более чем в 3 раза за неделю на сайте клиники. Кейс
Андрей
1
комментарий
0
читателей
Полный профиль
Андрей - У большинства сайтов произошел рост в Гугле в декабре и в марте Яндекса. Ваши шаманства тут не причём :)
Как доработка структуры вывела сайт в ТОП-10 Google и увеличила трафик в 2 раза. Кейс Связной Трэвел
Дмитрий
3
комментария
0
читателей
Полный профиль
Дмитрий - Вероятнее всего было обновление Google и позиции были снижены в связи с низкой скоростью загрузки страниц (так как доработке ведутся не только по SEO, но и в целом по функционалу сайта, появляются новые скрипты). В этот период в Google Search Console увеличилось количество страниц с низкой скоростью загрузки. Мы выявили несколько проблем, которые снижают скорость загрузки страниц и выдали рекомендации по их устранению. Пока данные рекомендации находятся в работе. Также был проведен анализ EAT факторов и проверка сайта на соответствие требованиям Google к YMYL сайта, выданы рекомендации по доработке данных факторов (ждем внедрения наших рекомендаций, поделимся потом результатами).
Рост ботных переходов на сайт: как интерпретировать и что делать
Mike
5
комментариев
0
читателей
Полный профиль
Mike - как это проверить? что товары выводится именно на основе спроса, а не по заданным алгоритмам?
Сравнительная статистика уровня жизни SEO-специалистов в семи странах, включая Россию
Рустам
1
комментарий
0
читателей
Полный профиль
Рустам - Средняя температура по больнице, подсчет даже близко не отображает действительность, особенно учитывая разность цен и уровня зп в разных частях больших стран (США, Канада, Россия)
Зарабатываем с помощью текстов: как создать уникальный контент и монетизировать сайт
Вячеслав Усольцев
1
комментарий
0
читателей
Полный профиль
Вячеслав Усольцев - А вот насчет фармы сильно поспорю. Уникальность ниже 60%, и все, хоть ты убейся, продвигаться оно у тебя не будет. Тот же визард сапы об этом говорит напрямую, и он прав. Ссылок тогда хоть все скупи, так и будешь болтаться даже по СЧ на третьей странице. Как минимум два раза сталкивался с ситуацией, когда просто рерайт до уникальности ровно по той же Тзшке (только % уника другой ставил) давал дюжий прирост. Там точно было ок все остальное, и ссылки хорошо подрости на эту страницу, поэтому результат точно дала именно уникальность И плюс по фарме почему-то заметил тенденцию (именно по ней, в других тематиках не так явно) - делаешь CTA 2 раза на странице - в 2 раза растет конверсия. Ну не в 2, конечно, но близко. Жалко, с производителями такое не работает
ТОП КОММЕНТАТОРОВ
Комментариев
910
Комментариев
834
Комментариев
554
Комментариев
540
Комментариев
483
Комментариев
385
Комментариев
373
Комментариев
262
Комментариев
249
Комментариев
171
Комментариев
156
Комментариев
141
Комментариев
121
Комментариев
114
Комментариев
97
Комментариев
97
Комментариев
96
Комментариев
92
Комментариев
80
Комментариев
77
Комментариев
74
Комментариев
67
Комментариев
62
Комментариев
60
Комментариев
59

Отправьте отзыв!
Отправьте отзыв!