DeepSeek представила мультимодальную модель, которая приблизилась к Claude Opus 4.8
Компания DeepSeek представила экспериментальную модель DeepSeek-V4-Flash-Vision-Exp. Она создана на базе V4 Flash, но в отличие от текстовой версии получила поддержку изображений: модель распознает содержимое фотографий и скриншотов, анализирует графики и использует визуальную информацию при выполнении задач.
По оценке самой DeepSeek, текстовые возможности новой модели – рассуждение, знания и работа в агентных сценариях – находятся на уровне V4 Flash. В тестах, где ИИ-агенту требуется одновременно понимать визуальную информацию и выполнять действия, V4-Flash-Vision-Exp приблизилась к Claude Opus 4.8 от Anthropic. Независимого подтверждения этих результатов пока нет.
Claude Opus 4.8 вышла в конце мая 2026 года. Anthropic позиционирует ее как свою наиболее производительную общедоступную модель; она рассчитана в том числе на программирование, работу ИИ-агентов, рассуждения и сложные профессиональные задачи.
DeepSeek-V4-Flash-Vision-Exp уже доступна через API компании. Ее контекстное окно составляет 1 млн токенов, максимальный объем ответа – 384 тыс. токенов. Изображения переводятся в токены и оплачиваются по тем же тарифам, что и запросы к V4 Flash; на одно изображение приходится не более 384 токенов. Модель поддерживает смешанные запросы из текста и изображений, а картинки загружаются напрямую, по ссылке или через Files API.
Для DeepSeek это не первый опыт с мультимодальными системами: ранее компания развивала семейство визуально-языковых моделей DeepSeek-VL. Новая версия впервые переносит работу с изображениями непосредственно в актуальную линейку V4 Flash и расширяет ее возможности для агентных сценариев.
DeepSeek представила официальную версию языковой модели DeepSeek V4 Pro. Она стала доступна в веб-версии, приложении и API компании.
Источник: Bloomberg
Случилось что-то важное? Поделитесь новостью с редакцией.





