DeepSeek выпустила экспериментальную версию своей быстрой модели с поддержкой изображений — DeepSeek V4 Flash Vision Exp. Она доступна через API: можно передать модели скриншот, документ, фотографию или схему и получить текстовый разбор.
Зацените: только до 17 сентября скидка 16% на любую профессию в Яндекс Практикуме. Если не сейчас, то когда?
Это важное, хотя и довольно ожидаемое обновление. Текстовые модели хорошо пишут, суммируют и рассуждают, но в реальной работе данные редко живут только в тексте. Мультимодальная модель позволяет не пересказывать ей содержимое вручную, а отдать исходный материал целиком.
Модель сравнивают с Claude Opus: говорят, что в отдельных тестах она его обходит. К таким формулировкам стоит относиться спокойно. Бенчмарки измеряют выполнение конкретных наборов задач и сильно зависят от настроек, промпта и того, какие примеры выбрали авторы теста. Высокий балл не гарантирует, что модель одинаково хорошо поймёт ваш скриншот из «Метрики», таблицу с кривыми формулами и фотографию доски после встречи.
У DeepSeek V4 Flash уже был большой контекст — до миллиона токенов, — а сама линейка позиционируется как более доступная альтернатива тяжёлым моделям для длинных задач и агентных сценариев.. Версия Vision добавляет к этому ещё один тип входных данных. Но пометка Exp означает, что интерфейс, качество и ограничения могут меняться, а ошибки при работе с картинками пока особенно стоит проверять вручную.
