NEWVectors or files. Pick a path.Start →

    Image Text To Text Models

    Browse AI models for multimodal decomposition and recomposition pipelines: plug any model into your extractors.

    813 models available

    Showing 385-408 of 813 models

    Image Text To Text

    Qwen/Qwen3.5-35B-A3B-Base

    126K
    144
    transformers
    Image Text To Text

    unsloth/gemma-3-4b-it

    126K
    28
    transformers
    Image Text To Text

    Qwen/Qwen2.5-VL-72B-Instruct

    125K
    651
    transformers
    Image Text To Text

    unsloth/llava-1.5-7b-hf-bnb-4bit

    125K
    8
    transformers
    Image Text To Text

    codgician/Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GPTQ-int4

    124K
    9
    transformers
    Image Text To Text

    nvidia/NVIDIA-Nemotron-Nano-12B-v2-VL-FP8

    124K
    52
    transformers
    Image Text To Text

    nvidia/NVIDIA-Nemotron-Nano-12B-v2-VL-NVFP4-QAD

    124K
    28
    transformers
    Image Text To Text

    ATH-MaaS/OvisOCR2

    123K
    457
    transformers
    Image Text To Text

    Salesforce/blip2-flan-t5-xl

    123K
    93
    transformers
    Image Text To Text

    cyankiwi/Qwen3-VL-30B-A3B-Instruct-AWQ-4bit

    122K
    10
    transformers
    Image Text To Text

    HuggingFaceTB/SmolVLM-500M-Instruct

    121K
    196
    transformers
    Image Text To Text

    stepfun-ai/Step-3.7-Flash-NVFP4

    121K
    64
    transformers
    Image Text To Text

    barrydeen/Qwen3.8-27B-AWQ-4bit

    121K
    9
    transformers
    Image Text To Text

    trl-internal-testing/tiny-MuseGlimmerForConditionalGeneration

    119K
    1
    transformers
    Image Text To Text

    HuggingFaceM4/idefics2-8b

    119K
    626
    transformers
    Image Text To Text

    unsloth/Qwen3-VL-8B-Instruct-GGUF

    118K
    64
    transformers
    Image Text To Text

    Qwen/Qwen3-VL-2B-Instruct-GGUF

    118K
    60
    transformers
    Image Text To Text

    stepfun-ai/Step-3.7-Flash

    118K
    441
    transformers
    Image Text To Text

    CohereLabs/North-Micro-Vision-Instruct

    118K
    141
    transformers
    Image Text To Text

    OpenGVLab/InternVL3_5-14B

    118K
    30
    transformers
    Image Text To Text

    trl-internal-testing/tiny-Qwen3_5ForConditionalGeneration-3.8

    117K
    transformers
    Image Text To Text

    DevQuasar/Qwen.Qwen3-VL-Embedding-2B-GGUF

    117K
    25
    Image Text To Text

    bartowski/Ornith-1.5-35B-A3B-GGUF

    116K
    37
    Image Text To Text

    cyankiwi/gemma-4-26B-A4B-it-AWQ-8bit

    116K
    10
    transformers
    17 / 34

    All models

    Every model page in one place, 390 in total.