Cohere выпустила North Micro Vision — компактную VLM на 2,4 млрд параметров

3 мин
Cohere выпустила North Micro Vision — компактную VLM на 2,4 млрд параметров

Cohere Labs выпустила North Micro Vision — компактную vision‑language model (VLM) с 2,4 млрд параметров. Это самая маленькая зрительно‑языковая модель компании на момент релиза. Основной скрипт North Micro Vision — работа с документами, таблицами, графиками, скриншотами, формами и другими структурированными изображениями.

Главное отличие модели от многих компактных VLM — обработка изображения в исходном разрешении. Обычно перед подачей в мультимодальную модель изображение приводят к фиксированному размеру. При таком ресайзе могут теряться мелкие элементы: текст, подписи на графиках, границы таблиц и другие детали. North Micro Vision сохраняет исходные пропорции изображения, что особенно полезно для document understanding и OCR. При этом высокое разрешение увеличивает требования к памяти и задержку обработки.

Модель выпущена с открытыми весами под лицензией Apache 2.0. Cohere позиционирует ее как компактную основу для прототипирования и task‑specific fine‑tuning — то есть дообучения под конкретную предметную область или тип документов.

Архитектура

Общий размер модели составляет приблизительно 2,4 млрд параметров. В ней используется vision encoder примерно на 400 млн параметров, обученный на основе SigLIP 2 SO400M, и языковая часть около на 2 млрд параметров.

Языковой backbone построен на архитектуре North Micro LLM. В основе — чередование sliding‑window attention и глобального attention без позиционных эмбеддингов. Для локального внимания используется RoPE, а глобальный слой не привязан к позиционной разметке. Такой оформление позволяет сочетать локальный контекст с возможностью учитывать информацию на уровне всей последовательности.

Интереснее устроено соединение зрения и языка. Вместо того чтобы передавать языковой модели только один набор визуальных признаков, North Micro Vision использует информацию с нескольких уровней vision encoder и внедряет ее в ранние слои языковой части. Этот решение основан на архитектурной идее DeepStack: языковая модель получает визуальные признаки разной степени абстракции, а не только итоговое представление изображения.

За счет этого схема лучше сохраняет мелкие визуальные детали, которые особенно важны при разборе документов и структурированных изображений.

На что рассчитана модель

Cohere не позиционирует North Micro Vision как замену крупным универсальным мультимодальным моделям. Ее преимущество — в компактности и специализированных сценариях.

Основные задачи — visual question answering, OCR, распознавание и разбор документов, работа с графиками и таблицами, visual grounding и извлечение структурированных данных. Поддерживаются равным образом некоторое количество изображений в одном запросе и мультиязычный ввод.

Небольшое количество параметров делает модель интересной для локального запуска и дообучения. Cohere отдельно указывает на возможность использовать ее как базовую модель для создания специализированного visual expert под конкретный набор данных.

При этом ограничения тоже существенны. North Micro Vision не является reasoning‑моделью, а ее способности к математическим и программным задачам ограничены. Кроме того, native‑resolution обработка может заметно увеличивать потребление памяти и время инференса по мере роста размера изображения.

Бенчмарки

В опубликованном сравнении Cohere схема сопоставлялась с другими компактными VLM. Сильнее всего North Micro Vision демонстрирует себя именно на задачах, для которых она и проектировалась: документация, графики, понимание структуры изображения и visual grounding.

По данным Cohere, на DocVQA модель получила 0,921, на ChartQA — 0,808, на AI2D — 0,775, а на RefCOCO — 0,732. При этом на более общих тестах вроде MMMU результаты значительно слабее.

Разработчики оптимизировали схема под конкретный класс мультимодальных задач, где критичны детали изображения, пространственная структура и извлечение информации из визуальных данных. Мы получили минимальный размер модели в обмен на специализацию и возможность функционировать непосредственно с визуальными деталями исходного изображения.

Читают сейчас

28 минут назад

Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО»

Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО» Организация «Базальт СПО» запускает специальное предложение для школ: операционная система «Альт Образование» 11 п

Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite

37 минут назад

Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite

Google запустила агентный анализ видео для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Теперь модель анализирует видео не как последовательность кадров с фиксированной частотой, а сама решает, какие

Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур

1 час назад

Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур

В новых версиях «Октопус» мы сфокусировались на трёх направлениях: расширении возможностей управления ИТ-инфраструктурой, повышении производительности и развитии интеграций. Система получила новые сце

Frank Media рассказал о сложностях, с которыми столкнулись пользователи при попытке воспользоваться цифровым рублём

1 час назад

Frank Media рассказал о сложностях, с которыми столкнулись пользователи при попытке воспользоваться цифровым рублём

С 1 сентября должно было начаться массовое добавление цифрового рубля — третьей формы денег, которую Банк России обсуждает уже около шести лет. Тем не менее, судя по первым дням запуска, доступ к ново

2 часа назад

Digital Q.Sensor BI от «Диасофт» модернизировал ИИ-агента: визуальные правки дашбордов без доступа к данным

«Диасофт» представил обновленные возможности ИИ-агента платформы Digital Q.Sensor BI: теперь он может вносить правки в готовый дашборд, ориентируясь в том числе на его визуальное отображение. ИИ-агент