×

Мультимодальность Яндекса 2025–2026: как изображения превращаются в точки входа и что это значит для будущего SEO

Россия +7 (909) 261-97-71
Шрифт:
0 794
Подпишитесь на нас в MAX

От поиска похожих картинок к диалогу с ИИ по фото: специалист по поисковой оптимизации Demis Group, Фёдорова Юлия, рассказывает, как мультимодальные модели (VLM) меняют логику видимости, трафика и доверия, и почему оптимизация изображений теперь требует не только технической грамотности, но и стратегического мышления.

До 2024 года поиск по изображениям в Яндексе оставался инструментом ретроспективного сравнения: пользователь загружал фото – система находила визуально схожие объекты. Это был поиск по внешнему признаку, а не по смыслу. Он работал хорошо для задач вроде «найти ту же футболку» или «определить модель смартфона», но не позволял задавать вопросы о содержании самого изображения.

Всё изменилось с запуском мультимодальных нейроответов в рамках «Поиска с Алисой» и обновлением «Умной камеры» в мобильном приложении Яндекса (осень 2024 – весна 2025). Теперь пользователь может сфотографировать объект, например, натюрморт в музее, неизвестное растение в лесу, техническое устройство на производств, и спросить:

  • «Что это?»

  • «Для чего служит?»

  • «Что символизируют элементы картины?»

Это уже диалог с ИИ на основе визуального контекста. Система сама интерпретирует смысл, опираясь на объединенную модель зрения и языка (VLM).

Такой сдвиг кардинально меняет поведенческие паттерны:

  • Пользователи все чаще начинают взаимодействие с брендом не через текстовый запрос, а через фото.

  • Визуальные запросы становятся первичным точками входа, особенно в e-commerce, туризме, образовании и B2B.

  • Доля «нулевых кликов» растет: если ИИ дает развернутый ответ прямо в интерфейсе (включая название товара, цену, назначение), переход на сайт становится опциональным.

Ключевое отличие новой парадигмы – переход от сопоставления к пониманию.

Именно поэтому SEO для изображений теперь часть мультимодальной стратегии цитируемости, где каждое фото должно быть не просто найдено, а понято и процитировано ИИ как достоверный источник информации.

Технология VLM в Яндексе: архитектура и принципы работы

Мультимодальный поиск в Яндексе – это результат интеграции визуальной лингвистической модели (VLM), системы, способной одновременно обрабатывать визуальную и текстовую информацию, чтобы сформировать осмысленный, контекстуально точный ответ. В отличие от классических систем компьютерного зрения, которые ограничиваются детекцией объектов («это чашка»), или языковых моделей (LLM), оперирующих только текстом, VLM объединяет оба мира, что делает ее ключевым компонентом «Нейро» и «Умной камеры».

Архитектура Яндекс.VLM

Согласно публичным данным и техническим презентациям Яндекса (2024–2025), архитектура VLM состоит из трех ключевых компонентов:

  1. Энкодер изображений – основан на Vision Transformer (ViT) или глубокой CNN-сети. Он преобразует пиксели изображения в плотное векторное представление (embedding), фиксируя не только форму и цвет, но и семантические признаки: «кофейная чашка», «музейный натюрморт», «технический узел».

  2. Языковая модель (LLM) – в роли выступает YandexGPT 3+. Она генерирует естественный язык, но не из внутренней памяти, а на основе внешних источников и визуального контекста.

  3. Адаптер (projection layer) – нейросетевой мост между двумя модальностями. Именно он проецирует визуальные эмбеддинги в семантическое пространство языковой модели, позволяя LLM «понимать» содержание изображения так, как если бы оно было описано словами.

Такой подход позволяет модели не просто сказать «на фото кофе», а ответить на вопрос пользователя:

«Для чего служит этот предмет?» → «Это керамическая чашка для горячих напитков, обычно используется для кофе или чая».

От распознавания к интерпретации

Ключевое преимущество VLM – контекстуальная интерпретация. Например:

  • Если пользователь фотографирует растение и спрашивает «Это съедобно?», модель не просто называет вид, а добавляет ботаническую справку и предостережение (если применимо).

  • При съемке картины в музее запрос «Что символизируют лимоны на этом натюрморте?» приводит к ответу, основанному на историко-культурных данных, а не на визуальной классификации.

Это особенно важно для e-commerce: VLM может анализировать фото товара и автоматически генерировать SEO-описание с указанием материала, функций и применения – что уже внедрено в внутренние инструменты Яндекс Маркета.

Ограничения и вызовы

Несмотря на мощь, современные VLM все еще сталкиваются с трудностями:

  • Низкокачественные изображения (размытость, плохое освещение) снижают точность анализа.

  • Отсутствие текстового контекста на странице делает невозможным связь изображения с брендом или ценой.

  • Сложные сцены (например, переполненная полка в магазине) могут привести к ошибочной идентификации объекта.

Поэтому успех в мультимодальном поиске зависит не только от алгоритмов Яндекса, но и от того, насколько сайт помогает модели «понять» изображение – через структурированные данные, качественные фото и семантическое окружение.

Новые возможности «Умной камеры» и нейроответов: практические сценарии

С выходом обновленной «Умной камеры» в мобильном приложении Яндекса (осень 2024 – весна 2025) визуальный поиск превратился в интерактивного ассистента, способного не только распознавать объекты, но и отвечать на вопросы о них в естественном языке. Эта функция, построенная на той же VLM-архитектуре, что и «Нейро» в десктопном поиске, открывает десятки новых пользовательских сценариев – и, соответственно, точек входа для брендов.

Как это работает на практике

Пользователь наводит камеру на:

  • Растение в парке → спрашивает: «Что это за цветок? Ядовит ли он?» → получает ботаническое описание, уровень токсичности и советы по уходу.

  • Экспонат в музее → спрашивает: «Кто художник? Что символизируют лимоны на этой картине?» → получает историко-культурный контекст.

  • Техническое устройство на производстве → спрашивает: «Для чего эта деталь? Где купить аналог?» → получает функциональное описание и ссылки на поставщиков.

  • Упаковку товара в магазине → спрашивает: «Какие аналоги дешевле? Есть ли отзывы?» → получает сравнение цен и цитаты из обзоров.

Во всех этих случаях ИИ не просто идентифицирует объект – он формирует нарратив, опираясь на структурированные данные из открытых источников. И если ваш сайт содержит авторитетную, хорошо размеченную информацию о растениях, картинах, промышленных компонентах или товарах – он может стать источником цитирования в таком ответе.

Сценарии по отраслям:

Ниша

Пример использования

Возможность для бренда

E-commerce

Покупатель сканирует упаковку конкурента и спрашивает: «Есть ли органическая альтернатива?»

Ваш продукт может быть предложен как решение – если его фото и описание оптимизированы под VLM и размещены с микроразметкой Product + ImageObject.

Туризм / Музеи

Турист фотографирует архитектурный элемент и спрашивает: «Кто построил этот собор?»

Официальный сайт музея или гид-сервис может быть процитирован – при наличии качественных изображений с подписями и исторической справкой.

Образование

Студент сканирует формулу на доске и спрашивает: «Что означает этот символ?»

Учебный портал с размеченными FAQ и научными пояснениями может попасть в ответ.

B2B / Промышленность

Инженер фотографирует запчасть без маркировки и спрашивает: «Подходит ли она к насосу X?»

Каталог с техническими чертежами, совместимостью и структурированными спецификациями становится источником доверия.

Почему одни сайты попадают в ответы, а другие – нет

Анализ нейроответов показывает, что ИИ выбирает источники, которые:

  1. Содержат изображение, максимально близкое к запросу (по визуальным признакам).

  2. Окружены текстом, прямо отвечающим на вопрос (не общие слова, а конкретика: «лимон в натюрмортах XVII века символизировал богатство и тщетность земных благ»).

  3. Имеют микроразметку (ImageObject, Question, Answer, FAQPage).

  4. Принадлежат авторитетным доменам (часто – .edu, .gov, известные СМИ, официальные сайты).

Оптимизация изображений под мультимодальный поиск: технический блок

В эпоху VLM техническая оптимизация изображений становится фундаментом видимости в мультимодальных ответах. Если изображение не проиндексировано корректно или загружается медленно, оно исключается из пула источников для генеративных ответов в «Нейро» и «Умной камере». Ниже – ключевые технические требования, которые напрямую влияют на шансы попасть в AI-цитирование.

Форматы, качество и скорость загрузки

VLM-модели Яндекса требуют четких, хорошо освещенных изображений с высоким разрешением. Однако скорость загрузки остается критичной для UX и индексации:

  • Используйте современные форматы: WebP и AVIF обеспечивают на 30–50% меньший размер при том же качестве по сравнению с JPEG/PNG.

  • Оптимизируйте сжатие: баланс между качеством и весом – целевой размер для hero-изображения: ≤300 КБ при разрешении ≥1200px по ширине.

  • Адаптивные изображения: используйте < picture > с srcset, чтобы подавать оптимальный размер под устройство.

Медленная загрузка = низкий сигнал качества → снижение вероятности цитирования.

Специфические требования Яндекс Маркета (с мая 2025)

Для e-commerce-проектов, интегрированных с Яндекс Маркетом, введены обязательные рекомендации:

  • Вертикальный формат 3×4 (например, 1200×1600 px) вместо квадратного.

  • Белый или нейтральный фон без посторонних объектов.

  • Товар должен занимать ≥85% площади кадра.

Эти правила стандартизируют входные данные для VLM, что повышает точность распознавания и генерации описаний.

Инструменты диагностики

  • Яндекс Вебмастер → «Анализ сайта» → «Изображения»:
    Показывает, какие картинки проиндексированы, есть ли ошибки в alt/title, как часто они появляются в выдаче.

  • PageSpeed Insights / Lighthouse:
    Анализирует эффективность форматов и сжатия.

  • Семантический аудит через эмбеддинги:
    Сравните векторное представление вашего изображения (через CLIP API) с запросами вроде «кофейная чашка» – чем ближе совпадение, тем выше шанс попасть в релевантный ответ.

Контентная оптимизация изображений: от alt-текста к визуальному E-E-A-T

Если техническая подготовка изображения обеспечивает его индексируемость, то контентная оптимизация определяет его цитируемость в мультимодальных ответах Яндекса.

Alt-текст: не ключи, а семантическое ядро

Традиционный подход – заполнение alt списком ключевых слов («купить чашку кофе керамика ручная работа») – теперь работает против вас. VLM интерпретирует такой текст как спам или низкокачественный контент. Вместо этого alt должен быть естественным, фактологичным и структурированным:

Правильно:

< img alt="Керамическая чашка для кофе с ручной росписью 'Морская волна', объем 300 мл, произведена в мастерской Artisan Ceramics (Санкт-Петербург)" >

Этот alt:

  • содержит конкретные данные (объем, название коллекции);

  • указывает источник происхождения (мастерская, город);

  • использует естественный язык, понятный как человеку, так и ИИ.

Такой подход напрямую усиливает E-E-A-T (Experience, Expertise, Authoritativeness, Trustworthiness) – критерий, который Яндекс явно использует при отборе источников для «Нейро».

Роль окружающего текста и подписей

VLM анализирует не только само изображение, но и его семантическое окружение:

  • заголовок (< h1 >–< h3 >), в котором упоминается объект;

  • подпись под фото (< figcaption > или < p class="caption" >);

  • основной текст страницы, описывающий функции, историю, применение.

Как фотографировать для VLM

Не все изображения одинаково «понятны» нейросети. Чтобы повысить шансы на корректную интерпретацию:

  • Показывайте объект целиком – без обрезки важных деталей.

  • Используйте нейтральный фон – особенно для товаров (требование Яндекс Маркета с 2025 г.).

  • Делайте крупные планы ключевых элементов – например, роспись на чашке, логотип, швы.

  • Добавляйте контекстные сцены – чашка в руке, на столе с кофе, в подарочной упаковке.

VLM лучше распознает объекты в естественной среде, но при этом требует четкой фокусировки на основном предмете.

Типичные ошибки, убивающие видимость

  • Пустой или шаблонный alt: alt="изображение" или alt="товар".

  • Отсутствие подписей и заголовков: фото «висит» в тексте без пояснений.

  • Несоответствие изображения и текста: на фото – чашка, в тексте – общие слова о «керамике» без привязки к объекту.

  • Использование стоковых фото без указания происхождения: VLM не может подтвердить достоверность.

Все эти ошибки сигнализируют модели: «этот источник не заслуживает доверия» – и исключают вас из пула цитирования.

Заключение

Мультимодальность Яндекса – это фундаментальный сдвиг в логике поисковой видимости. Изображение становится самостоятельной точкой входа, через которую пользователь начинает диалог с ИИ о мире вокруг него. В 2026 году бренд, чье фото не оптимизировано под VLM (Visual Language Model), рискует остаться невидимым даже при идеальном текстовом SEO.

Ключевой вывод прост: чтобы быть цитируемым в нейроответах, нужно говорить на языке, понятном одновременно человеку и машине.

Есть о чем рассказать? Тогда присылайте свои материалы в редакцию.


Новые 
Новые
Лучшие
Старые
Сообщество
Подписаться 
Подписаться на дискуссию:
E-mail:
ОК
Вы подписаны на комментарии
Ошибка. Пожалуйста, попробуйте ещё раз.
Отправить отзыв
ПОПУЛЯРНЫЕ ОБСУЖДЕНИЯ НА SEONEWS
Мы сократили рутину SEO-специалиста на 95% – вот архитектура, которая это сделала
Гостьkorayaskin
2
комментария
0
читателей
Полный профиль
Гостьkorayaskin - Можно также посмотреть разбор инструментов типа KeywordKick — помогает быстрее понять, где именно конфликт сигналов.
Как ChatGPT выбирает компании для рекомендаций: что уже известно и как бизнесу подготовиться к эпохе AI Search
Сергей Семенов
1
комментарий
0
читателей
Полный профиль
Сергей Семенов - Спасибо за вопрос. Нет, полностью автоматически отчёт не генерируется. Мы сознательно не пошли по пути «нажал кнопку — получил PDF». В RECOMO мы используем ИИ как инструмент анализа, а не как замену методологии. Наш процесс состоит из нескольких этапов: Проводится серия проверок в различных AI-системах (ChatGPT, Gemini, Claude и других) по заранее сформированной методике и набору запросов. Собираются данные о том, какие компании рекомендуются, в каком контексте, какие источники используются и какие цифровые сигналы присутствуют. Далее ИИ помогает структурировать и анализировать большой объём информации, выявлять закономерности и формировать черновики выводов. После этого отчёт обязательно проходит экспертную проверку нашей командой. Мы дополняем его интерпретацией результатов, практическими рекомендациями и проверяем, чтобы выводы действительно соответствовали данным. Пока рынок AI Search только формируется, полностью доверять генерацию подобных аудитов одной языковой модели было бы неправильно. Именно поэтому мы сочетаем собственную методологию, автоматизированный сбор и анализ данных и экспертную валидацию результатов. Наша цель — не просто красиво оформить отчёт, а дать бизнесу рекомендации, которые действительно помогут повысить AI Visibility и увеличить вероятность появления бренда в рекомендациях современных AI-систем.
Накрутка ПФ vs Бизнес: как накрутка поведенческих факторов «убьет» ваш бизнес в интернете
Гость
1
комментарий
0
читателей
Полный профиль
Гость - Вообще бред несут-пункт позиции и там и там суотрудничать,банов нет,риски и остальные пункты просто смешно,пф гораздо эффективнее чем платить в пиксель)))
Сервисы для создания квизов: сравнение по конверсии, гибкости сценариев и интеграциям
Виктор
1
комментарий
0
читателей
Полный профиль
Виктор - Без сервиса FormDesigner.ru эта подборка будет не полной. Удивлен, почему вы его не включили в список?
5 полезных сервисов для работы с учебными текстами
Anna B.
2
комментария
0
читателей
Полный профиль
Anna B. - Отличный разбор, очень своевременно!
Битрикс24 запускает бесплатный курс по вайбкодингу для гуманитариев
Ирина
1
комментарий
0
читателей
Полный профиль
Ирина - Хорошее решение для бизнеса
Сайт компании в 2026 году: что проверяет Роскомнадзор и как не получить штраф
Олег Черников
1
комментарий
0
читателей
Полный профиль
Олег Черников - Дима спасибо, отличный обзор! За ГОСТ Р 52872-2019 спасибо! Давно около него ходил.
Yandex Cloud сменил логотип и визуальный стиль
Гостьфы
1
комментарий
0
читателей
Полный профиль
Гостьфы - это че такое
Яндекс добавил продвинутую ИИ-модель в Алису на всех умных устройствах
Тимофей
1
комментарий
0
читателей
Полный профиль
Тимофей - Какой смысл усовершенствовать если в нашей стране запрещено говорить правду!
Рынок безалкогольных напитков в 2026 году: как категория продает через доверие к бренду
Алексей
1
комментарий
0
читателей
Полный профиль
Алексей - Все бы хорошо, но это в прошлом. В 2026 г. о росте 2020-2025 гг. остается только мечтать. Рынок БАН перешел к снижению. К серьезному снижению.
ТОП КОММЕНТАТОРОВ
Комментариев
910
Комментариев
834
Комментариев
554
Комментариев
540
Комментариев
483
Комментариев
393
Комментариев
373
Комментариев
262
Комментариев
249
Комментариев
171
Комментариев
156
Комментариев
142
Комментариев
130
Комментариев
121
Комментариев
100
Комментариев
97
Комментариев
97
Комментариев
96
Комментариев
80
Комментариев
77
Комментариев
74
Комментариев
67
Комментариев
66
Комментариев
60
Комментариев
59

Отправьте отзыв!
Отправьте отзыв!