> ## Documentation Index
> Fetch the complete documentation index at: https://usefulai.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Best Vision LLMs in 2026

> Compare the best vision LLMs in 2026 by score, price, and access, with picks for documents, charts, screenshots, and multimodal agents.

<div className="uai-updated-row">Updated July 12, 2026</div>

Vision LLMs read images, screenshots, charts, and PDFs, then answer in text. The hard part is matching one to your job: a cheap high-volume reader and a frontier document-reasoner sit far apart on price, speed, and accuracy. These 17 picks cover both ends of that range.

## Best Vision LLMs

<div className="uai-overview-table uai-overview-table--ranked">
  |  # | Model                                                                                                                                                                                          | Best for                                   | Score <Tooltip tip="UsefulAI's 0-100 vision score combines normalized Arena Vision preference and Artificial Analysis MMMU-Pro results. Higher is better."><span className="uai-tip-icon"><Icon icon="circle-info" size={12} color="currentColor" /><span className="uai-sr-only">About score</span></span></Tooltip> | Price <Tooltip tip="Comparable USD per 1,000 one-megapixel images for the represented route. Tokenization, resolution, caching, and output can change the real cost."><span className="uai-tip-icon"><Icon icon="circle-info" size={12} color="currentColor" /><span className="uai-sr-only">About price</span></span></Tooltip> | License <Tooltip tip="Proprietary means no public model weights. Open weight means weights are available, though exact licenses and commercial-use terms vary."><span className="uai-tip-icon"><Icon icon="circle-info" size={12} color="currentColor" /><span className="uai-sr-only">About license</span></span></Tooltip> |
  | -: | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------------------------------------------ | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
  |  1 | <a href="https://www.anthropic.com/news/claude-opus-4-7" target="_blank" rel="noreferrer"><img src={"/images/icons/48/anthropic.com.png"} alt="" noZoom />Claude Opus 4.7</a>                  | High-accuracy document and diagram reading |                                                                                                                                                                                                                                                                                                                   96% |                                                                                                                                                                                                                                                                                                                           \$6.70 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  2 | <a href="https://deepmind.google/models/model-cards/gemini-3-5-flash/" target="_blank" rel="noreferrer"><img src={"/images/icons/48/google.com.png"} alt="" noZoom />Gemini 3.5 Flash</a>      | Cheap high-volume image and document work  |                                                                                                                                                                                                                                                                                                                   96% |                                                                                                                                                                                                                                                                                                                           \$0.84 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  3 | <a href="https://ai.meta.com/blog/introducing-muse-spark-msl/" target="_blank" rel="noreferrer"><img src={"/images/icons/48/meta.ai.png"} alt="" noZoom />Muse Spark</a>                       | Multimodal reasoning and tool use          |                                                                                                                                                                                                                                                                                                                   95% |                                                                                                                                                                                                                                                                                                                    Not disclosed | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  4 | <a href="https://ai.google.dev/gemini-api/docs/models/gemini-3.1-pro-preview" target="_blank" rel="noreferrer"><img src={"/images/icons/48/google.com.png"} alt="" noZoom />Gemini 3.1 Pro</a> | Deep visual reasoning and analysis         |                                                                                                                                                                                                                                                                                                                   95% |                                                                                                                                                                                                                                                                                                                           \$1.12 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  5 | <a href="https://developers.openai.com/api/docs/models/gpt-5.5" target="_blank" rel="noreferrer"><img src={"/images/icons/48/openai.com.png"} alt="" noZoom />GPT-5.5</a>                      | Fast document and chart extraction         |                                                                                                                                                                                                                                                                                                                   95% |                                                                                                                                                                                                                                                                                                                           \$3.83 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  6 | <a href="https://www.anthropic.com/news/claude-opus-4-8" target="_blank" rel="noreferrer"><img src={"/images/icons/48/anthropic.com.png"} alt="" noZoom />Claude Opus 4.8</a>                  | Reliable agentic visual workflows          |                                                                                                                                                                                                                                                                                                                   94% |                                                                                                                                                                                                                                                                                                                           \$6.85 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  7 | <a href="https://docs.x.ai/developers/models/grok-4.5" target="_blank" rel="noreferrer"><img src={"/images/icons/48/x.ai.png"} alt="" noZoom />Grok 4.5</a>                                    | Long-context multimodal reasoning          |                                                                                                                                                                                                                                                                                                                   94% |                                                                                                                                                                                                                                                                                                                           \$2.05 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  8 | <a href="https://qwen.ai/blog?id=qwen3.7-plus" target="_blank" rel="noreferrer"><img src={"/images/icons/48/qwen.ai.png"} alt="" noZoom />Qwen3.7 Plus</a>                                     | Low-cost GUI and screen agents             |                                                                                                                                                                                                                                                                                                                   92% |                                                                                                                                                                                                                                                                                                                           \$0.41 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  9 | <a href="https://www.kimi.com/blog/kimi-k2-6" target="_blank" rel="noreferrer"><img src={"/images/icons/48/kimi.com.png"} alt="" noZoom />Kimi K2.6</a>                                        | Open-weight agentic vision work            |                                                                                                                                                                                                                                                                                                                   91% |                                                                                                                                                                                                                                                                                                                           \$1.30 | <span className="uai-badge uai-badge--emerald">Open weight</span>                                                                                                                                                                                                                                                            |
  | 10 | <a href="https://www.anthropic.com/news/claude-sonnet-5" target="_blank" rel="noreferrer"><img src={"/images/icons/48/anthropic.com.png"} alt="" noZoom />Claude Sonnet 5</a>                  | Balanced everyday vision work              |                                                                                                                                                                                                                                                                                                                   89% |                                                                                                                                                                                                                                                                                                                           \$4.12 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  | 11 | <a href="https://www.minimax.io/models/text/m3" target="_blank" rel="noreferrer"><img src={"/images/icons/48/minimax.io.png"} alt="" noZoom />MiniMax-M3</a>                                   | Cheapest capable open-weight vision        |                                                                                                                                                                                                                                                                                                                   88% |                                                                                                                                                                                                                                                                                                                           \$0.39 | <span className="uai-badge uai-badge--emerald">Open weight</span>                                                                                                                                                                                                                                                            |
  | 12 | <a href="https://huggingface.co/google/gemma-4-31B-it" target="_blank" rel="noreferrer"><img src={"/images/icons/48/google.com.png"} alt="" noZoom />Gemma 4 31B</a>                           | Local vision on a high-end GPU             |                                                                                                                                                                                                                                                                                                                   86% |                                                                                                                                                                                                                                                                                                                           \$0.00 | <span className="uai-badge uai-badge--emerald">Open weight</span>                                                                                                                                                                                                                                                            |
  | 13 | <a href="https://docs.z.ai/guides/vlm/glm-5v-turbo" target="_blank" rel="noreferrer"><img src={"/images/icons/48/z.ai.png"} alt="" noZoom />GLM-5V Turbo</a>                                   | Vision-driven coding and UI work           |                                                                                                                                                                                                                                                                                                                   82% |                                                                                                                                                                                                                                                                                                                           \$1.23 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  | 14 | <a href="https://www.anthropic.com/news/claude-fable-5-mythos-5" target="_blank" rel="noreferrer"><img src={"/images/icons/48/anthropic.com.png"} alt="" noZoom />Claude Fable 5</a>           | Frontier reasoning on complex documents    |                                                                                                                                                                                                                                                                                                                   75% |                                                                                                                                                                                                                                                                                                                          \$13.69 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  | 15 | <a href="https://openai.com/index/gpt-5-6/" target="_blank" rel="noreferrer"><img src={"/images/icons/48/openai.com.png"} alt="" noZoom />GPT-5.6 Sol</a>                                      | Frontier reasoning on hard visuals         |                                                                                                                                                                                                                                                                                                                   74% |                                                                                                                                                                                                                                                                                                                           \$5.12 | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  | 16 | <a href="https://huggingface.co/Qwen/Qwen3.6-27B" target="_blank" rel="noreferrer"><img src={"/images/icons/48/qwen.ai.png"} alt="" noZoom />Qwen3.6 27B</a>                                   | Mid-range self-hosted vision               |                                                                                                                                                                                                                                                                                                                   68% |                                                                                                                                                                                                                                                                                                                           \$0.62 | <span className="uai-badge uai-badge--emerald">Open weight</span>                                                                                                                                                                                                                                                            |
  | 17 | <a href="https://huggingface.co/Qwen/Qwen3.5-4B" target="_blank" rel="noreferrer"><img src={"/images/icons/48/qwen.ai.png"} alt="" noZoom />Qwen3.5 4B</a>                                     | Vision on a typical laptop                 |                                                                                                                                                                                                                                                                                                                   61% |                                                                                                                                                                                                                                                                                                                           \$0.03 | <span className="uai-badge uai-badge--emerald">Open weight</span>                                                                                                                                                                                                                                                            |
</div>

<label className="uai-overview-more">
  <input type="checkbox" className="uai-overview-toggle" />

  <span className="uai-overview-more-open"><span className="uai-overview-more-count">Show more</span><Icon icon="chevron-down" size={13} /></span>
  <span className="uai-overview-more-close"><span>Show less</span><Icon icon="chevron-up" size={13} /></span>
</label>

***

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/tO2qspLJNjFc61Zv/images/icons/144/anthropic.com.png?fit=max&auto=format&n=tO2qspLJNjFc61Zv&q=85&s=2077996fd7746bfe8ee85acdd8018de3" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/anthropic.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Claude Opus 4.7](https://www.anthropic.com/news/claude-opus-4-7)

        <span className="uai-itemcard-byline">Anthropic</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">High-accuracy document and diagram reading</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://www.anthropic.com/news/claude-opus-4-7" target="_blank" rel="noreferrer" aria-label="Visit Claude Opus 4.7" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Anthropic</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The strongest complete benchmark performer here for dense documents, diagrams, and charts, if your work rewards precision over price.
    </div>

    <div className="uai-itemcard-facts" aria-label="Claude Opus 4.7 facts">
      <span>Score <strong>96%</strong></span>
      <span>Price <strong>{"$6.70"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>4.32s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-opus-4-7-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-opus-4-7-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Opus 4.7 reads cluttered PDFs, nested tables, and technical figures with a care that cheaper models miss, and it stays reliable across long, multi-page documents.</li>
            <li>When a misread number is expensive, in finance, legal, or analytics, this is the safe pick.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-opus-4-7-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-opus-4-7-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>You pay premium rates, and it isn't the fastest to first response. For high-volume extraction where small errors are tolerable, Gemini 3.5 Flash and GPT-5.5 cost far less.</li>
            <li>Opus 4.8 is the newer sibling if you want the current flagship instead.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-opus-4-7-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-opus-4-7-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://claude.ai" target="_blank" rel="noreferrer" className="underline underline-offset-2">Claude</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://platform.claude.com/docs/en/about-claude/models/overview" target="_blank" rel="noreferrer" className="underline underline-offset-2">Claude API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Ez-pJDkPpztLE7Cr/images/icons/144/google.com.png?fit=max&auto=format&n=Ez-pJDkPpztLE7Cr&q=85&s=11e0c725f841c45443116a184b63beac" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/google.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Gemini 3.5 Flash](https://deepmind.google/models/model-cards/gemini-3-5-flash/)

        <span className="uai-itemcard-byline">Google</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Cheap high-volume image and document work</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://deepmind.google/models/model-cards/gemini-3-5-flash/" target="_blank" rel="noreferrer" aria-label="Visit Gemini 3.5 Flash" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Google</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      Google's low-cost workhorse ties for the highest complete score here while costing a fraction of the frontier models, making it the default for volume.
    </div>

    <div className="uai-itemcard-facts" aria-label="Gemini 3.5 Flash facts">
      <span>Score <strong>96%</strong></span>
      <span>Price <strong>{"$0.84"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>11.24s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemini-3-5-flash-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemini-3-5-flash-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Flash pairs near-top vision accuracy with pricing built for scale, so batch document parsing and screen reading stay affordable.</li>
            <li>It handles layout-heavy documents better than its price suggests, which makes it the sensible default for high-volume pipelines.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemini-3-5-flash-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemini-3-5-flash-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Time to first token is slow for a Flash model, so it's less suited to snappy interactive use than GPT-5.5. On the hardest single-document reasoning, Opus 4.7 and Gemini 3.1 Pro pull ahead.</li>
            <li>Pick it for volume, not peak accuracy.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemini-3-5-flash-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemini-3-5-flash-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://gemini.google.com" target="_blank" rel="noreferrer" className="underline underline-offset-2">Gemini</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://ai.google.dev/gemini-api/docs/models" target="_blank" rel="noreferrer" className="underline underline-offset-2">Gemini API</a> and <a href="https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/gemini/3-5-flash" target="_blank" rel="noreferrer" className="underline underline-offset-2">Gemini Enterprise Agent Platform</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/52KaILwddzz5TNZ_/images/icons/144/meta.ai.png?fit=max&auto=format&n=52KaILwddzz5TNZ_&q=85&s=67eba125dab2438bdf2c8a33074498c7" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/meta.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Muse Spark](https://ai.meta.com/blog/introducing-muse-spark-msl/)

        <span className="uai-itemcard-byline">Meta</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Multimodal reasoning and tool use</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://ai.meta.com/blog/introducing-muse-spark-msl/" target="_blank" rel="noreferrer" aria-label="Visit Muse Spark" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Meta</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The benchmarked Muse Spark release is a strong natively multimodal reasoner, but its direct route is Meta AI rather than a public API or self-hosting.
    </div>

    <div className="uai-itemcard-facts" aria-label="Muse Spark facts">
      <span>Score <strong>95%</strong></span>
      <span>Price <strong>{"Not disclosed"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>Not disclosed</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-muse-spark-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-muse-spark-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Built from the ground up to reason across images, audio, and tools in one model, Muse Spark is a capable option for multimodal help inside Meta AI.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-muse-spark-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-muse-spark-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>The benchmarked version has no public API, local route, image price, or comparable latency. Meta's newer Muse Spark 1.1 has a public-preview API but is not the model scored here.</li>
            <li>Choose Gemini 3.5 Flash or GPT-5.5 if you need a benchmarked API model.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-muse-spark-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-muse-spark-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://www.meta.ai/" target="_blank" rel="noreferrer" className="underline underline-offset-2">Meta AI</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Ez-pJDkPpztLE7Cr/images/icons/144/google.com.png?fit=max&auto=format&n=Ez-pJDkPpztLE7Cr&q=85&s=11e0c725f841c45443116a184b63beac" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/google.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Gemini 3.1 Pro](https://ai.google.dev/gemini-api/docs/models/gemini-3.1-pro-preview)

        <span className="uai-itemcard-byline">Google</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Deep visual reasoning and analysis</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://ai.google.dev/gemini-api/docs/models/gemini-3.1-pro-preview" target="_blank" rel="noreferrer" aria-label="Visit Gemini 3.1 Pro" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Google</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The Pro-tier Gemini for tasks that need careful visual reasoning rather than fast extraction, deeper than Flash and priced close to it.
    </div>

    <div className="uai-itemcard-facts" aria-label="Gemini 3.1 Pro facts">
      <span>Score <strong>95%</strong></span>
      <span>Price <strong>{"$1.12"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>16.42s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemini-3-1-pro-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemini-3-1-pro-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Gemini 3.1 Pro is designed for multi-step visual reasoning - reading a chart, connecting it to surrounding text, and drawing a conclusion - while staying inexpensive.</li>
            <li>It's a strong middle ground when accuracy matters but frontier prices don't fit.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemini-3-1-pro-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemini-3-1-pro-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It's a preview model and slow to first token, so it's poor for latency-sensitive or high-volume work where Flash is faster and cheaper.</li>
            <li>On the very hardest documents, Opus 4.7 still edges it. Confirm preview stability before you depend on it.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemini-3-1-pro-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemini-3-1-pro-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://gemini.google.com" target="_blank" rel="noreferrer" className="underline underline-offset-2">Gemini</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://ai.google.dev/gemini-api/docs/models/gemini-3.1-pro-preview" target="_blank" rel="noreferrer" className="underline underline-offset-2">Gemini API</a> and <a href="https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/gemini/3-1-pro" target="_blank" rel="noreferrer" className="underline underline-offset-2">Gemini Enterprise Agent Platform</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/openai.com.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=745b8837f7535bc53cd70fc2f7024d58" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/openai.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [GPT-5.5](https://developers.openai.com/api/docs/models/gpt-5.5)

        <span className="uai-itemcard-byline">OpenAI</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Fast document and chart extraction</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://developers.openai.com/api/docs/models/gpt-5.5" target="_blank" rel="noreferrer" aria-label="Visit GPT-5.5" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit OpenAI</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      OpenAI's fastest strong vision model returns a quick first response with excellent document, chart, and layout reading, ideal for interactive tools.
    </div>

    <div className="uai-itemcard-facts" aria-label="GPT-5.5 facts">
      <span>Score <strong>95%</strong></span>
      <span>Price <strong>{"$3.83"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>1.87s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gpt-5-5-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gpt-5-5-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>GPT-5.5 returns a first token faster than the other highlighted frontier models while remaining strong on documents, charts, and screenshots.</li>
            <li>That combination makes it the standout for interactive workflows where responsiveness is the point.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gpt-5-5-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gpt-5-5-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It costs substantially more than the Gemini tier for a similar overall score, so the premium only makes sense when its much faster first response matters.</li>
            <li>For batch processing, Gemini 3.5 Flash is the better-value option.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gpt-5-5-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gpt-5-5-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://chatgpt.com" target="_blank" rel="noreferrer" className="underline underline-offset-2">ChatGPT</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://developers.openai.com/api/docs/models/gpt-5.5" target="_blank" rel="noreferrer" className="underline underline-offset-2">OpenAI API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/tO2qspLJNjFc61Zv/images/icons/144/anthropic.com.png?fit=max&auto=format&n=tO2qspLJNjFc61Zv&q=85&s=2077996fd7746bfe8ee85acdd8018de3" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/anthropic.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Claude Opus 4.8](https://www.anthropic.com/news/claude-opus-4-8)

        <span className="uai-itemcard-byline">Anthropic</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Reliable agentic visual workflows</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://www.anthropic.com/news/claude-opus-4-8" target="_blank" rel="noreferrer" aria-label="Visit Claude Opus 4.8" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Anthropic</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      Anthropic's current flagship is tuned to be more honest and reliable than 4.7, making it the pick when a vision agent runs unattended.
    </div>

    <div className="uai-itemcard-facts" aria-label="Claude Opus 4.8 facts">
      <span>Score <strong>94%</strong></span>
      <span>Price <strong>{"$6.85"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>Not disclosed</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-opus-4-8-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-opus-4-8-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Opus 4.8 is Anthropic's current flagship for PDFs, diagrams, messy layouts, and agentic work.</li>
            <li>It is the better default than 4.7 when current model support and unattended workflows matter more than the older version's stronger complete benchmark result.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-opus-4-8-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-opus-4-8-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It's among the priciest models here, so for straightforward extraction it's overkill; Gemini 3.5 Flash and Qwen3.7 Plus do that job for far less.</li>
            <li>Reach for 4.8 when reliability under autonomy, not cost, is what you're optimizing for.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-opus-4-8-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-opus-4-8-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://claude.ai" target="_blank" rel="noreferrer" className="underline underline-offset-2">Claude</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://platform.claude.com/docs/en/about-claude/models/overview" target="_blank" rel="noreferrer" className="underline underline-offset-2">Claude API</a> and <a href="https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-anthropic-claude-opus-4-8.html" target="_blank" rel="noreferrer" className="underline underline-offset-2">Amazon Bedrock</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/sV7VJe4pqO2Le0pu/images/icons/144/x.ai.png?fit=max&auto=format&n=sV7VJe4pqO2Le0pu&q=85&s=421f0adc6c1e753bf2ad0cd1661abbc7" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/x.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Grok 4.5](https://docs.x.ai/developers/models/grok-4.5)

        <span className="uai-itemcard-byline">xAI</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Long-context multimodal reasoning</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://docs.x.ai/developers/models/grok-4.5" target="_blank" rel="noreferrer" aria-label="Visit Grok 4.5" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit xAI</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      xAI's flagship pairs strong multimodal reasoning with a very large context window, so it can hold many images and long documents at once.
    </div>

    <div className="uai-itemcard-facts" aria-label="Grok 4.5 facts">
      <span>Score <strong>94%</strong></span>
      <span>Price <strong>{"$2.05"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>6.57s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-grok-4-5-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-grok-4-5-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Grok 4.5 keeps many images and long documents in one context, which suits multi-image comparisons and large visual workloads.</li>
            <li>It's priced below the top Claude and GPT tiers for that capability.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-grok-4-5-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-grok-4-5-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Independent vision benchmarking is still thin, so treat its standing as less settled than Gemini's or Claude's. For document precision, Opus 4.7 and GPT-5.5 have a longer track record.</li>
            <li>It's at its best when context size is the binding constraint.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-grok-4-5-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-grok-4-5-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://grok.com" target="_blank" rel="noreferrer" className="underline underline-offset-2">Grok</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://docs.x.ai/developers/models/grok-4.5" target="_blank" rel="noreferrer" className="underline underline-offset-2">xAI API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/qwen.ai.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=77ec239e207f3d7865895d11af129b39" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/qwen.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Qwen3.7 Plus](https://qwen.ai/blog?id=qwen3.7-plus)

        <span className="uai-itemcard-byline">Alibaba</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Low-cost GUI and screen agents</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://qwen.ai/blog?id=qwen3.7-plus" target="_blank" rel="noreferrer" aria-label="Visit Qwen3.7 Plus" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Alibaba</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      A cheap, fast multimodal agent model built to read screens and drive interfaces, with strong value for GUI automation and screenshot work.
    </div>

    <div className="uai-itemcard-facts" aria-label="Qwen3.7 Plus facts">
      <span>Score <strong>92%</strong></span>
      <span>Price <strong>{"$0.41"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>3.25s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-7-plus-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-7-plus-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Qwen3.7 Plus reads screens and images and is tuned for agentic GUI and CLI tasks, all at a fraction of frontier pricing.</li>
            <li>If you're building screen-reading or app-navigating agents at scale, the cost-to-capability ratio here is hard to beat.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-7-plus-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-7-plus-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It's proprietary and API-only, with no first-party app or local route, and on the hardest document reasoning it sits below Opus 4.7 and Gemini 3.1 Pro.</li>
            <li>Great for high-volume agent work, weaker for peak-accuracy analysis.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-7-plus-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-7-plus-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://www.alibabacloud.com/help/en/model-studio/models" target="_blank" rel="noreferrer" className="underline underline-offset-2">Alibaba Cloud Model Studio</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/52KaILwddzz5TNZ_/images/icons/144/kimi.com.png?fit=max&auto=format&n=52KaILwddzz5TNZ_&q=85&s=8d6772935f3f8299f61c9820fd6d176d" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/kimi.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Kimi K2.6](https://www.kimi.com/blog/kimi-k2-6)

        <span className="uai-itemcard-byline">Moonshot AI</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Open-weight agentic vision work</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://www.kimi.com/blog/kimi-k2-6" target="_blank" rel="noreferrer" aria-label="Visit Kimi K2.6" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Moonshot AI</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The strongest open-weight pick here for agentic multimodal work, with a hosted app and API if you'd rather not run it yourself.
    </div>

    <div className="uai-itemcard-facts" aria-label="Kimi K2.6 facts">
      <span>Score <strong>91%</strong></span>
      <span>Price <strong>{"$1.30"}</strong></span>
      <span>License <span className="uai-badge uai-badge--emerald">Open weight</span></span>
      <span>Vision latency <strong>3.26s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-kimi-k2-6-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-kimi-k2-6-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Kimi K2.6 brings capable image understanding to a genuinely open-weight model, and it holds up on long-context, agent-style tasks.</li>
            <li>You get a hosted app and API for convenience, plus the option to inspect or self-host the weights when you need control.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-kimi-k2-6-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-kimi-k2-6-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It's a trillion-parameter model, so "open weight" doesn't mean local; realistic self-hosting needs serious infrastructure, not a workstation.</li>
            <li>For pure document accuracy, Opus 4.7 and Gemini still lead. Choose it when open weights genuinely matter to you.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-kimi-k2-6-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-kimi-k2-6-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://www.kimi.com" target="_blank" rel="noreferrer" className="underline underline-offset-2">Kimi</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://platform.kimi.ai/docs/guide/kimi-k2-6-quickstart" target="_blank" rel="noreferrer" className="underline underline-offset-2">Kimi Platform</a> and <a href="https://openrouter.ai/moonshotai/kimi-k2.6" target="_blank" rel="noreferrer" className="underline underline-offset-2">OpenRouter</a>.</li>
            <li><strong>Run locally</strong> — Open weights are available from <a href="https://huggingface.co/moonshotai/Kimi-K2.6" target="_blank" rel="noreferrer" className="underline underline-offset-2">Hugging Face</a>, but in practice this needs self-hosting infrastructure, not a local machine.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/tO2qspLJNjFc61Zv/images/icons/144/anthropic.com.png?fit=max&auto=format&n=tO2qspLJNjFc61Zv&q=85&s=2077996fd7746bfe8ee85acdd8018de3" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/anthropic.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Claude Sonnet 5](https://www.anthropic.com/news/claude-sonnet-5)

        <span className="uai-itemcard-byline">Anthropic</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Balanced everyday vision work</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://www.anthropic.com/news/claude-sonnet-5" target="_blank" rel="noreferrer" aria-label="Visit Claude Sonnet 5" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Anthropic</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      Anthropic's balanced daily driver delivers fast, reliable vision that covers most everyday document and image tasks without paying Opus prices.
    </div>

    <div className="uai-itemcard-facts" aria-label="Claude Sonnet 5 facts">
      <span>Score <strong>89%</strong></span>
      <span>Price <strong>{"$4.12"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>2.57s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-sonnet-5-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-sonnet-5-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Sonnet 5 handles the bulk of real vision work - reading documents, screenshots, and charts - quickly and dependably, with the same careful behavior as the Opus line.</li>
            <li>For most teams it hits the sweet spot of speed, accuracy, and cost.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-sonnet-5-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-sonnet-5-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>On the hardest, densest documents it gives up ground to Opus 4.7 and 4.8, and cheaper models like Gemini 3.5 Flash undercut it on price.</li>
            <li>Step up to Opus when precision is critical, step down when volume rules.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-sonnet-5-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-sonnet-5-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://claude.ai" target="_blank" rel="noreferrer" className="underline underline-offset-2">Claude</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://platform.claude.com/docs/en/about-claude/models/overview" target="_blank" rel="noreferrer" className="underline underline-offset-2">Claude API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/minimax.io.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=a2ce393f0bc7d77c5581e74dad7e6064" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/minimax.io.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [MiniMax-M3](https://www.minimax.io/models/text/m3)

        <span className="uai-itemcard-byline">MiniMax</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Cheapest capable open-weight vision</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://www.minimax.io/models/text/m3" target="_blank" rel="noreferrer" aria-label="Visit MiniMax-M3" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit MiniMax</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      About the cheapest way to get solid open-weight vision through an API, and a strong value if raw cost is your main driver.
    </div>

    <div className="uai-itemcard-facts" aria-label="MiniMax-M3 facts">
      <span>Score <strong>88%</strong></span>
      <span>Price <strong>{"$0.39"}</strong></span>
      <span>License <span className="uai-badge uai-badge--emerald">Open weight</span></span>
      <span>Vision latency <strong>3.22s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-minimax-m3-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-minimax-m3-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>MiniMax-M3 delivers competent image and document understanding at rock-bottom hosted pricing, and its open weights let you route it through whichever host is cheapest.</li>
            <li>For high-volume, cost-sensitive vision where you don't need frontier accuracy, it's a smart budget option.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-minimax-m3-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-minimax-m3-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Despite open weights, it's too large for practical local use, so you're on a hosted API anyway. It trails Kimi K2.6 and the proprietary leaders on hard reasoning.</li>
            <li>Pick it for price, and look elsewhere for peak accuracy.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-minimax-m3-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-minimax-m3-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://platform.minimax.io/docs/guides/models-intro" target="_blank" rel="noreferrer" className="underline underline-offset-2">MiniMax API</a> and <a href="https://openrouter.ai/minimax/minimax-m3" target="_blank" rel="noreferrer" className="underline underline-offset-2">OpenRouter</a>.</li>
            <li><strong>Run locally</strong> — Open weights are available from <a href="https://huggingface.co/MiniMaxAI/MiniMax-M3" target="_blank" rel="noreferrer" className="underline underline-offset-2">Hugging Face</a>, but in practice this needs self-hosting infrastructure, not a local machine.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Ez-pJDkPpztLE7Cr/images/icons/144/google.com.png?fit=max&auto=format&n=Ez-pJDkPpztLE7Cr&q=85&s=11e0c725f841c45443116a184b63beac" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/google.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Gemma 4 31B](https://huggingface.co/google/gemma-4-31B-it)

        <span className="uai-itemcard-byline">Google</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Local vision on a high-end GPU</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://huggingface.co/google/gemma-4-31B-it" target="_blank" rel="noreferrer" aria-label="View Gemma 4 31B on Hugging Face" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">View on Hugging Face</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The best genuinely self-hostable vision model here: with a strong GPU you get capable image understanding without a mandatory metered API fee.
    </div>

    <div className="uai-itemcard-facts" aria-label="Gemma 4 31B facts">
      <span>Score <strong>86%</strong></span>
      <span>Price <strong>{"$0.00"}</strong></span>
      <span>License <span className="uai-badge uai-badge--emerald">Open weight</span></span>
      <span>Vision latency <strong>2.39s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemma-4-31b-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemma-4-31b-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Gemma 4 31B runs locally on a high-end machine, giving you private, offline vision without a model-usage fee. It's also currently free through a hosted route if you'd rather not manage hardware.</li>
            <li>That makes it useful for privacy-sensitive work, although local hardware still has a cost.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemma-4-31b-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemma-4-31b-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>You need a serious GPU and enough memory to run it well, and it trails the proprietary leaders on the hardest documents.</li>
            <li>If you can use the cloud, Gemini 3.5 Flash is stronger and still cheap. Choose it for control and privacy.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gemma-4-31b-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gemma-4-31b-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://openrouter.ai/google/gemma-4-31b-it:free" target="_blank" rel="noreferrer" className="underline underline-offset-2">OpenRouter</a>.</li>
            <li><strong>Run locally</strong> — If you have a high-end machine, you can run it with <a href="https://ollama.com/library/gemma4:31b" target="_blank" rel="noreferrer" className="underline underline-offset-2">Ollama</a> after downloading weights from <a href="https://huggingface.co/google/gemma-4-31B-it" target="_blank" rel="noreferrer" className="underline underline-offset-2">Hugging Face</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/sV7VJe4pqO2Le0pu/images/icons/144/z.ai.png?fit=max&auto=format&n=sV7VJe4pqO2Le0pu&q=85&s=d720f43ee25f6663eb6cb5ad076ac3ad" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/z.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [GLM-5V Turbo](https://docs.z.ai/guides/vlm/glm-5v-turbo)

        <span className="uai-itemcard-byline">Z.ai</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Vision-driven coding and UI work</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://docs.z.ai/guides/vlm/glm-5v-turbo" target="_blank" rel="noreferrer" aria-label="Visit GLM-5V Turbo" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Z.ai</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      A native multimodal model tuned to turn what it sees - screenshots, design drafts, layouts - into working code and UI actions.
    </div>

    <div className="uai-itemcard-facts" aria-label="GLM-5V Turbo facts">
      <span>Score <strong>82%</strong></span>
      <span>Price <strong>{"$1.23"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>Not disclosed</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-glm-5v-turbo-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-glm-5v-turbo-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>GLM-5V Turbo is built to fuse visual perception with code, so screenshot-to-code, design-to-UI, and layout-driven agent tasks land better than on general vision models.</li>
            <li>If your vision work ends in code or interface actions, this is a purpose-built option.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-glm-5v-turbo-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-glm-5v-turbo-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It's narrower than the generalist leaders and weaker on open-ended document reasoning, where Opus 4.7 and Gemini 3.1 Pro do more, and its latency isn't published.</li>
            <li>Reach for it for vision-to-code specifically, not broad visual analysis.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-glm-5v-turbo-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-glm-5v-turbo-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://docs.z.ai/guides/vlm/glm-5v-turbo" target="_blank" rel="noreferrer" className="underline underline-offset-2">Z.ai API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/tO2qspLJNjFc61Zv/images/icons/144/anthropic.com.png?fit=max&auto=format&n=tO2qspLJNjFc61Zv&q=85&s=2077996fd7746bfe8ee85acdd8018de3" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/anthropic.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Claude Fable 5](https://www.anthropic.com/news/claude-fable-5-mythos-5)

        <span className="uai-itemcard-byline">Anthropic</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Frontier reasoning on complex documents</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://www.anthropic.com/news/claude-fable-5-mythos-5" target="_blank" rel="noreferrer" aria-label="Visit Claude Fable 5" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Anthropic</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      Anthropic's new premium model targets deeply nested diagrams and tables, but at the highest price here it's overkill for routine vision.
    </div>

    <div className="uai-itemcard-facts" aria-label="Claude Fable 5 facts">
      <span>Score <strong>75%</strong></span>
      <span>Price <strong>{"$13.69"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>Not disclosed</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-fable-5-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-fable-5-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Fable 5 excels at the hardest, most document-heavy reasoning - untangling diagrams, charts, and tables buried inside long PDFs - and it can carry demanding, long-horizon analysis further than lighter models.</li>
            <li>When a problem genuinely needs frontier reasoning over visuals, it delivers.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-fable-5-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-fable-5-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>The price is the dealbreaker for everyday vision; it's the most expensive model here by a wide margin, and its standardized vision-benchmark coverage is thin.</li>
            <li>For most document work, Opus 4.7 and Sonnet 5 give you most of the value for far less.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-claude-fable-5-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-claude-fable-5-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://claude.ai" target="_blank" rel="noreferrer" className="underline underline-offset-2">Claude</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://platform.claude.com/docs/en/about-claude/models/overview" target="_blank" rel="noreferrer" className="underline underline-offset-2">Claude API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/openai.com.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=745b8837f7535bc53cd70fc2f7024d58" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/openai.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [GPT-5.6 Sol](https://openai.com/index/gpt-5-6/)

        <span className="uai-itemcard-byline">OpenAI</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Frontier reasoning on hard visuals</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://openai.com/index/gpt-5-6/" target="_blank" rel="noreferrer" aria-label="Visit GPT-5.6 Sol" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit OpenAI</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      OpenAI's newest frontier model brings heavy reasoning to visual problems, but very high latency makes it a deliberate choice, not an interactive one.
    </div>

    <div className="uai-itemcard-facts" aria-label="GPT-5.6 Sol facts">
      <span>Score <strong>74%</strong></span>
      <span>Price <strong>{"$5.12"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Vision latency <strong>26.97s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gpt-5-6-sol-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gpt-5-6-sol-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>GPT-5.6 Sol applies top-tier reasoning to hard visual and document problems, and when a task rewards slow, careful analysis over speed, that depth shows.</li>
            <li>It's a serious option for complex, high-stakes visual reasoning where you can afford to wait for the answer.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gpt-5-6-sol-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gpt-5-6-sol-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>First-token latency is the highest here by far and it's expensive, so it's wrong for interactive or high-volume vision. As a new release its vision-benchmark standing is still thin.</li>
            <li>For fast document work, GPT-5.5 is far quicker and cheaper.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-gpt-5-6-sol-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-gpt-5-6-sol-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://chatgpt.com" target="_blank" rel="noreferrer" className="underline underline-offset-2">ChatGPT</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://developers.openai.com/api/docs/models/gpt-5.6-sol" target="_blank" rel="noreferrer" className="underline underline-offset-2">OpenAI API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/qwen.ai.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=77ec239e207f3d7865895d11af129b39" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/qwen.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Qwen3.6 27B](https://huggingface.co/Qwen/Qwen3.6-27B)

        <span className="uai-itemcard-byline">Alibaba</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Mid-range self-hosted vision</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://huggingface.co/Qwen/Qwen3.6-27B" target="_blank" rel="noreferrer" aria-label="View Qwen3.6 27B on Hugging Face" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">View on Hugging Face</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      A mid-tier open-weight model you can self-host on strong hardware or call cheaply through an API, with decent rather than leading vision.
    </div>

    <div className="uai-itemcard-facts" aria-label="Qwen3.6 27B facts">
      <span>Score <strong>68%</strong></span>
      <span>Price <strong>{"$0.62"}</strong></span>
      <span>License <span className="uai-badge uai-badge--emerald">Open weight</span></span>
      <span>Vision latency <strong>3.02s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-6-27b-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-6-27b-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Qwen3.6 27B gives you open weights and a real self-hosting path on a high-end machine, plus cheap hosted access if you prefer.</li>
            <li>For private, moderate-stakes vision work where you want control without the largest models' footprint, it's a reasonable middle option.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-6-27b-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-6-27b-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Accuracy sits well behind the leaders, so it's not for demanding analysis.</li>
            <li>Gemma 4 31B is a stronger open-weight pick at a similar size, making Qwen3.6 27B hard to choose unless its deployment profile fits your constraints better.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-6-27b-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-6-27b-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://www.alibabacloud.com/help/en/model-studio/vision" target="_blank" rel="noreferrer" className="underline underline-offset-2">Alibaba Cloud Model Studio</a> and <a href="https://openrouter.ai/qwen/qwen3.6-27b" target="_blank" rel="noreferrer" className="underline underline-offset-2">OpenRouter</a>.</li>
            <li><strong>Run locally</strong> — If you have a high-end machine, you can run it with <a href="https://huggingface.co/docs/transformers/index" target="_blank" rel="noreferrer" className="underline underline-offset-2">Transformers</a> after downloading weights from <a href="https://huggingface.co/Qwen/Qwen3.6-27B" target="_blank" rel="noreferrer" className="underline underline-offset-2">Hugging Face</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/qwen.ai.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=77ec239e207f3d7865895d11af129b39" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/qwen.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Qwen3.5 4B](https://huggingface.co/Qwen/Qwen3.5-4B)

        <span className="uai-itemcard-byline">Alibaba</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Vision on a typical laptop</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://huggingface.co/Qwen/Qwen3.5-4B" target="_blank" rel="noreferrer" aria-label="View Qwen3.5 4B on Hugging Face" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">View on Hugging Face</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The one model here that genuinely runs on a normal laptop: small and limited, but private and practical for light vision.
    </div>

    <div className="uai-itemcard-facts" aria-label="Qwen3.5 4B facts">
      <span>Score <strong>61%</strong></span>
      <span>Price <strong>{"$0.03"}</strong></span>
      <span>License <span className="uai-badge uai-badge--emerald">Open weight</span></span>
      <span>Vision latency <strong>0.70s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-5-4b-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-5-4b-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Qwen3.5 4B is small enough to run on a typical machine, giving you offline, private image understanding without a model-usage fee.</li>
            <li>For simple captioning, basic document reading, and on-device prototyping, it's a genuinely useful small model; actual speed depends on your hardware and quantization.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-5-4b-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-5-4b-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It has the lowest accuracy here, so it struggles with anything complex or detail-critical; don't trust it on dense documents.</li>
            <li>For real analysis, almost everything above it is far stronger. Use it for light, local, low-stakes tasks only.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="vision-llms-qwen3-5-4b-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="vision-llms-qwen3-5-4b-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://huggingface.co/Qwen/Qwen3.5-4B" target="_blank" rel="noreferrer" className="underline underline-offset-2">Hugging Face Inference Providers</a>.</li>
            <li><strong>Run locally</strong> — You can run it locally with <a href="https://ollama.com/library/qwen3.5:4b" target="_blank" rel="noreferrer" className="underline underline-offset-2">Ollama</a> after downloading weights from <a href="https://huggingface.co/Qwen/Qwen3.5-4B" target="_blank" rel="noreferrer" className="underline underline-offset-2">Hugging Face</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

***

## How to Choose

When choosing between these models, consider:

* **Access:** Decide first whether you'll use the model in an app, call it through an API, or run it locally, because that single choice drives cost, privacy, latency, and setup work more than small score differences do. Qwen3.5 4B runs on a typical laptop; Gemma 4 31B and Qwen3.6 27B need high-end local hardware. Open-weight leaders like Kimi K2.6 and MiniMax-M3 need self-hosting infrastructure, not a workstation.
* **Quality:** We use a vision score that blends Arena's vision arena (human preference, style-controlled) with Artificial Analysis's MMMU-Pro visual reasoning, normalized to a percentage. Two caveats matter. Claude Opus 4.8 and Grok 4.5 carry observed-only scores that aren't directly comparable to the fully benchmarked models above them, and the newest premium models, Claude Fable 5 and GPT-5.6 Sol, rank lower than their reputations suggest mainly because standardized vision coverage lags their release.
* **Price:** We compare USD per 1,000 one-megapixel images at 1024x1024, image input only. It's the cleanest way to line up costs, though your real bill also depends on the text tokens each request generates.
* **Vision Latency:** Time to first token for one image plus roughly 1,000 input tokens, where lower is better. It captures responsiveness, not throughput. Gemini 3.5 Flash is slow to first token but built for high-volume batches, so match the metric to how you'll actually use the model.

***

## Other Models We Considered

<div className="not-prose my-4 flex flex-col gap-1.5 uai-article-prose text-zinc-700 dark:text-zinc-300">
  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/qwen.ai.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=dd7a3821c277e432380635e28c70dc83" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/qwen.ai.png" /><a href="https://huggingface.co/Qwen/Qwen3.5-397B-A17B" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Qwen3.5 397B A17B</a> <span className="uai-ink-muted">(Alibaba)</span> — Tops the Qwen3.5 line on quality, but far too large for local use.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/82PG1Up2qz4DPkMj/images/icons/48/google.com.png?fit=max&auto=format&n=82PG1Up2qz4DPkMj&q=85&s=d44aa6f953cf72e889c25d7f615750e5" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/google.com.png" /><a href="https://ai.google.dev/gemini-api/docs/models/gemini-3-pro-preview" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Gemini 3 Pro</a> <span className="uai-ink-muted">(Google)</span> — Excellent in its day, now retired in favor of Gemini 3.1 Pro.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/qwen.ai.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=dd7a3821c277e432380635e28c70dc83" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/qwen.ai.png" /><a href="https://huggingface.co/Qwen/Qwen3-VL-235B-A22B-Instruct" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Qwen3-VL 235B A22B</a> <span className="uai-ink-muted">(Alibaba)</span> — Popular incumbent with mature tooling, now superseded by newer Qwen models.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/huggingface.co.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=760541dee73285f3eb28c4ced26d9a3c" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/huggingface.co.png" /><a href="https://moondream.ai/models/moondream_3-1_9B_A2B" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Moondream 3.1 9B A2B</a> <span className="uai-ink-muted">(Moondream)</span> — Tiny local specialist for captioning, detection, and pointing on edge hardware.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/openai.com.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=21ac965dc6ee5751127e6d435043629b" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/openai.com.png" /><a href="https://openai.com/index/hello-gpt-4o/" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">GPT-4o</a> <span className="uai-ink-muted">(OpenAI)</span> — The multimodal baseline everyone knew, but the app and API route is retired.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/qwen.ai.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=dd7a3821c277e432380635e28c70dc83" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/qwen.ai.png" /><a href="https://huggingface.co/Qwen/Qwen2.5-VL-72B-Instruct" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Qwen2.5-VL 72B</a> <span className="uai-ink-muted">(Alibaba)</span> — Familiar predecessor still in existing deployments, since surpassed by newer models.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/huggingface.co.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=760541dee73285f3eb28c4ced26d9a3c" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/huggingface.co.png" /><a href="https://huggingface.co/lmms-lab/llava-onevision-qwen2-72b-ov-sft" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">LLaVA-OneVision 72B</a> <span className="uai-ink-muted">(LLaVA contributors)</span> — A recognizable open baseline, now well behind current vision models.</span>
  </span>
</div>

***

## Frequently Asked Questions

<AccordionGroup>
  <Accordion title={"What is the best vision LLM right now?"}>
    For peak document and diagram accuracy, Claude Opus 4.7 leads. For the best mix of accuracy and price, Gemini 3.5 Flash is the default recommendation; choose GPT-5.5 when first-response latency matters more.
  </Accordion>

  <Accordion title={"What is the best vision LLM for most people?"}>
    Gemini 3.5 Flash covers the widest range of everyday image and document work cheaply and well. If you want Anthropic's careful reading at a moderate price, Claude Sonnet 5 is the close alternative.
  </Accordion>

  <Accordion title={"What is the best cheap or free vision LLM?"}>
    Gemma 4 31B has no model-usage fee when run locally on a high-end machine and is currently free through a hosted route. Qwen3.5 4B costs almost nothing and runs on a normal laptop, while MiniMax-M3 is the cheapest capable paid hosted option.
  </Accordion>

  <Accordion title={"What is the best vision LLM you can run locally?"}>
    Qwen3.5 4B is the only pick here that runs on a typical laptop. If you have a high-end GPU, Gemma 4 31B is the stronger local choice.
  </Accordion>

  <Accordion title={"What is the best open-weight vision LLM?"}>
    Kimi K2.6 is the strongest open-weight model on this list, though it's large enough that most people will use it hosted rather than self-hosted.
  </Accordion>

  <Accordion title={"Is Gemini 3.5 Flash better than GPT-5.5?"}>
    It depends on the job. Flash is much cheaper and is the better-value batch option; GPT-5.5 returns a much faster first response. For interactive tools, GPT-5.5; for high-volume pipelines, Flash.
  </Accordion>

  <Accordion title={"Do vision benchmarks match real-world use?"}>
    Roughly. They track document reading and visual reasoning well, but they don't capture your exact images, latency needs, or task mix. Test the top two or three candidates on your own inputs before committing.
  </Accordion>

  <Accordion title={"What should I use instead of GPT-4o?"}>
    GPT-5.5 is the direct upgrade for fast, high-detail document reading. If cost and volume matter more, Gemini 3.5 Flash is the better move.
  </Accordion>
</AccordionGroup>
