# Buying inference for an agent fleet: coding plans vs. APIs

> A maintained comparison of coding subscriptions and direct API prices, with reproducible calculations, automation restrictions, and a changelog. The buying decision depends on caching, quota utilization, and useful work delivered.

- Canonical: https://jedarden.com/data/inference-plans/
- Published: 2026-09-07
- Updated: 2026-09-07
- Last verified: 2026-09-07
- Tags: agents, cost, orchestration

---

Once coding workers can keep themselves busy, inference becomes a purchasing decision. A subscription buys an allowance that expires. An API bills for the work requested. Both can be economical, and both can be wasted.

In [The unit economics of running cattle](/notes/unit-economics-of-cattle/), I argued for measuring cost per completed outcome. This artifact applies that discipline to buying inference: which offers deserve a trial, what their advertised units mean, and where the apparent savings disappear.

**Analysis date: September 7, 2026.**

This is a maintained research artifact. Prices are in USD before tax; individual source checks and usage captures retain their own dates in the dataset. The calculations model billing; they do not establish model quality, sustained throughput, or the cost of a shipped application. The [changelog](#changelog) records substantive revisions. Publication dates, editorial updates, and source-verification dates serve different purposes.

## Measure the workload first

The baseline now comes from an actual local usage scan captured **September 7, 2026 at 14:55 UTC**, using Tokscale 4.15.1. It covers the locally discovered Claude Code, Codex and ZCode histories in one scan, across **871,701 recorded messages**. This is an accumulated history snapshot, not one month of usage or a deduplicated total across every machine. The [aggregate measurement](/data/inference-plans/usage-profile.json) contains the exact counters and derivation; no prompts or session records are included.

<!-- inference:usage:start -->

<div class="inference-record-list inference-usage-list" role="region" aria-label="Measured token composition">
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title">Fresh input</span><span class="inference-record-metric">2,293,232,314</span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Share of all tokens</dt><dd>2.794%</dd></div><div><dt>Per 1M output</dt><dd>5.985M</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title">Cache reads</span><span class="inference-record-metric">78,848,276,612</span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Share of all tokens</dt><dd>96.082%</dd></div><div><dt>Per 1M output</dt><dd>205.776M</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title">Cache writes</span><span class="inference-record-metric">538,768,695</span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Share of all tokens</dt><dd>0.657%</dd></div><div><dt>Per 1M output</dt><dd>1.406M</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title">Output, including billed reasoning</span><span class="inference-record-metric">383,174,954</span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Share of all tokens</dt><dd>0.467%</dd></div><div><dt>Per 1M output</dt><dd>1.000M</dd></div></dl></div>
</details>
</div>
<p class="inference-total"><strong>82.06B measured tokens; 213.2:1 total input/output; 96.53% of input served from cache.</strong> All input includes fresh input, cache reads and cache writes.</p>

<!-- inference:usage:end -->

Tokscale's model report keeps separately reported reasoning outside its output field. I add that bucket once to obtain billable output; reasoning already included by a client stays inside output. Cache reads and writes are separate from fresh input. This normalization follows the [versioned scanner implementation](https://github.com/junhoyeo/tokscale/blob/v4.15.1/crates/tokscale-core/src/lib.rs#L3804).

These are **measured usage proportions**, transferred into hypothetical purchases below. Another model, tokenizer, provider cache or session pattern can change them. In particular, the high cache-hit rate is not guaranteed on another service. Most processed tokens here are repeated context; maximizing that total alone would reward repetition rather than useful applications.

## What I would trial first

My shortlist from the published economics is **OpenCode Go for routine coding, Z.ai for sustained GLM-5.3 work, and Synthetic when its model selection or additional concurrency justifies a pack**. Keep a capped API balance available for overflow and difficult tasks. These are candidates to measure in the actual harness, not a ranking of coding quality.

The key eligibility question is whether the allowance covers the workload. A developer running a supported coding tool, an unattended coding worker, and a finished application serving customers can fall under different rules. An API-shaped endpoint does not establish permission for all three.

Each expanded plan reports **total processed tokens, with output in parentheses**, at the measured mix above. Each example spends the entire allowance on its named model; examples within one plan are alternatives. Weekly quotas are prorated to 30 days and assume full utilization within shorter limits. B means billion and M means million tokens. This is quota capacity, not a measured throughput promise or a model's per-request context window.

<!-- inference:plans:start -->

<div class="inference-plan-comparison" role="region" aria-label="Coding plan comparison">
<div class="inference-plan-comparison-head" aria-hidden="true"><span>Plan</span><span>Monthly price</span><span>Expandable details</span></div>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://opencode.ai/docs/go/">OpenCode Go</a></span><span class="inference-plan-price">$10</span><span class="inference-plan-counts">27 models / variants · 3 calculations</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>MiMo V2.5</li><li>MiniMax M3</li><li>Kimi K3</li><li>DeepSeek V4 Flash</li><li>GLM-5.3</li><li>GPT-5.6 Luna</li><li>MiMo V2.5 Pro</li><li>GLM-5.3-Flash</li><li>DeepSeek V4 Pro</li><li>Grok 4.6</li><li>GLM-5.2</li><li>GLM-5.1</li><li>Kimi K2.7 Code</li><li>Kimi K2.6</li><li>MiniMax M2.7</li><li>Qwen 3.8 Max</li><li>Qwen 3.8 Flash</li><li>Qwen 3.7 Max</li><li>Qwen 3.7 Plus</li><li>Qwen 3.6 Plus</li><li>LongCat 2.0</li><li>Muse Spark 1.3 Contributor</li><li>Muse Spark 1.2 Contributor</li><li>DeepSeek V4 Flash Vision Exp</li><li>Hy4</li><li>Hy3</li><li>Omen Alpha</li></ul><p class="inference-plan-source"><a href="https://opencode.ai/docs/go/">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li><strong>MiMo V2.5</strong><span>6.80B total <small>(31.73M output)</small></span></li><li><strong>MiniMax M3</strong><span>815.16M total <small>(3.81M output)</small></span></li><li><strong>Kimi K3</strong><span>32.48M total <small>(0.15M output)</small></span></li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>$60 API allowance for MiMo V2.5 and MiniMax M3; $30 for DeepSeek V4 Flash; $15 for K3, GLM-5.3 and DeepSeek V4 Pro. One shared pool, with shorter limits. Coding-agent traffic only.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://z.ai/subscribe">Z.ai Lite / Pro / Max</a></span><span class="inference-plan-price">$18 / $80 / $168</span><span class="inference-plan-counts">2 models / variants · 3 calculations</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>GLM-5.3</li><li>GLM-5.3-Flash</li></ul><p class="inference-plan-source"><a href="https://docs.z.ai/devpack/overview">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li><strong>Lite, GLM-5.3 off-peak</strong><span>432.12M total <small>(2.02M output)</small></span></li><li><strong>Pro, GLM-5.3 off-peak</strong><span>2.59B total <small>(12.11M output)</small></span></li><li><strong>Max, GLM-5.3 off-peak</strong><span>6.05B total <small>(28.25M output)</small></span></li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>10k / 60k / 140k credits weekly; model and cache weights apply. Half credit consumption off-peak. Supported coding tools; dynamic concurrency.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://synthetic.new/rate-limits">Synthetic</a></span><span class="inference-plan-price">$30 per pack</span><span class="inference-plan-counts">11 models / variants · 2 calculations</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>syn:large:text</li><li>syn:small:text</li><li>syn:large:vision</li><li>syn:small:vision</li><li>openai/gpt-oss-120b</li><li>zai-org/GLM-5.3-Flash</li><li>zai-org/GLM-5.2</li><li>moonshotai/Kimi-K3</li><li>Qwen/Qwen3.8-27B</li><li>zai-org/GLM-4.7-Flash</li><li>nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4</li></ul><p class="inference-plan-source"><a href="https://api.synthetic.new/openai/v1/models">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li><strong>GLM-5.3-Flash</strong><span>2.24B total <small>(10.45M output)</small></span></li><li><strong>Kimi-K3</strong><span>169.75M total <small>(0.79M output)</small></span></li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>$24 of its own API credits weekly; 500 weighted requests per five hours; one concurrent request per model per pack. More packs increase each limit.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://camelai.com/pricing">camelStream</a></span><span class="inference-plan-price">$5 per stream</span><span class="inference-plan-counts">5 models / variants · 1 calculation</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>DeepSeek V4 Flash</li><li>Gemini 3.7 Flash</li><li>GLM-5.3-Flash</li><li>GPT-5.6 Luna</li><li>Muse Spark 1.2</li></ul><p class="inference-plan-source"><a href="https://camelai.com/docs/stream/fleet">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li>Unmetered; throughput unknown</li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>Unmetered tokens; one generation per stream. Provider selects the model. No throughput guarantee; standard terms permit training on submitted content.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://platform.minimax.io/docs/guides/pricing-token-plan">MiniMax Token Plan</a></span><span class="inference-plan-price">$22 / $55 / $132</span><span class="inference-plan-counts">2 models / variants · 1 calculation</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>MiniMax M3</li><li>MiniMax M2.7</li></ul><p class="inference-plan-source"><a href="https://platform.minimax.io/docs/guides/pricing-token-plan">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li>Not quantifiable from published terms</li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>Five-hour and weekly limits; text, image and speech share quota. Current documentation lacks sufficient numerical quota detail for a defensible API-equivalent calculation.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://www.kimi.ai/resources/kimi-k3-pricing">Kimi membership / Code</a></span><span class="inference-plan-price">$19 / $39 / $99 / $199</span><span class="inference-plan-counts">3 models / variants · 1 calculation</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>Kimi K3</li><li>kimi-for-coding</li><li>kimi-for-coding-highspeed</li></ul><p class="inference-plan-source"><a href="https://www.kimi.ai/help/kimi-code/third-party-agents">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li>Not quantifiable from published terms</li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>Membership and coding benefits share resources. No fixed comparable token entitlement established here; personal Code benefits and production API access differ.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://www.alibabacloud.com/help/en/model-studio/coding-plan">Alibaba Cloud Coding Plan</a></span><span class="inference-plan-price">$50</span><span class="inference-plan-counts">10 models / variants · 1 calculation</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>qwen3.7-plus</li><li>qwen3.6-plus</li><li>kimi-k2.5</li><li>glm-5</li><li>MiniMax-M2.5</li><li>qwen3.5-plus</li><li>qwen3-max-2026-01-23</li><li>qwen3-coder-next</li><li>qwen3-coder-plus</li><li>glm-4.7</li></ul><p class="inference-plan-source"><a href="https://www.alibabacloud.com/help/en/model-studio/coding-plan">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li>Not quantifiable from published terms</li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>90k requests/month, 45k/week, 6k/five hours. Explicitly excludes automated scripts, application backends and noninteractive use.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://deepseekv4pro.com/pricing">deepseekv4pro.com</a></span><span class="inference-plan-price">$19.90 / $49.90; Agent $29.90</span><span class="inference-plan-counts">6 models / variants · 1 calculation</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>DeepSeek V4 Flash</li><li>DeepSeek V4 Pro</li><li>GLM-5.3</li><li>GLM-5.2</li><li>MiniMax M3</li><li>Kimi K3</li></ul><p class="inference-plan-source"><a href="https://deepseekv4pro.com/pricing">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li>Not quantifiable from published terms</li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>Independent reseller. Recurring promotional prices observed. Pricing cards and integration pages disagree on some quotas; model weighting and upstream plan rules apply.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan</a></span><span class="inference-plan-price">$6 / $16 / $50 / $100</span><span class="inference-plan-counts">2 models / variants · 4 calculations</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>MiMo V2.5</li><li>MiMo V2.5 Pro</li></ul><p class="inference-plan-source"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li><strong>Lite, V2.5 daytime</strong><span>650.12M total <small>(3.04M output)</small></span></li><li><strong>Standard, V2.5 daytime</strong><span>1.74B total <small>(8.14M output)</small></span></li><li><strong>Pro, V2.5 daytime</strong><span>6.03B total <small>(28.13M output)</small></span></li><li><strong>Max, V2.5 daytime</strong><span>13.00B total <small>(60.71M output)</small></span></li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>4.1B / 11B / 38B / 82B credits, with model-specific deductions. These are not raw tokens. Programming-tool restrictions apply.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://chutes.ai/pricing">Chutes</a></span><span class="inference-plan-price">$10 / $20</span><span class="inference-plan-counts">14 models / variants · 2 calculations</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>Qwen/Qwen3-32B-TEE</li><li>Qwen/Qwen3.5-397B-A17B-TEE</li><li>google/gemma-4-31B-turbo-TEE</li><li>zai-org/GLM-5.1-TEE</li><li>deepseek-ai/DeepSeek-V3.2-TEE</li><li>Qwen/Qwen3.6-27B-TEE</li><li>moonshotai/Kimi-K2.6-TEE</li><li>Qwen/Qwen3.8-27B-TEE</li><li>deepseek-ai/DeepSeek-V4-Flash-0731-TEE</li><li>zai-org/GLM-5.2-TEE</li><li>moonshotai/Kimi-K3-TEE</li><li>unsloth/Mistral-Nemo-Instruct-2407-TEE</li><li>Qwen/Qwen3-235B-A22B-Thinking-2507-TEE</li><li>Nemotron-3-Nano-Omni-30B-TEE</li></ul><p class="inference-plan-source"><a href="https://llm.chutes.ai/v1/models">Model source</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li><strong>Plus, Flash conditional ceiling</strong><span>785.87M total <small>(3.67M output)</small></span></li><li><strong>Pro, Flash conditional ceiling</strong><span>1.57B total <small>(7.34M output)</small></span></li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>Daily quotas and discounted overage. Published February policy caps subscription value at 5× its PAYG rates; confirm current rolling limits in the account.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://nano-gpt.com/blog/how-to-save-money-on-ai">NanoGPT</a></span><span class="inference-plan-price">$12 advertised</span><span class="inference-plan-counts">296 models / variants · 2 calculations</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>GLM 5.3 Flash</li><li>MiniMax M3</li><li>MiMo V2.5</li><li>MiMo V2.5 Pro</li><li>GLM 5.3</li><li>DeepSeek V4 Flash 0731</li><li>DeepSeek V4 Pro 0813</li></ul><p class="inference-plan-source">Showing 7 compared routes from 296 recorded models / variants. <a href="https://nano-gpt.com/api/subscription/v1/models?detailed=true">Browse the complete catalog</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li><strong>1× input weight</strong><span>258.35M total <small>(1.21M output)</small></span></li><li><strong>2× input weight</strong><span>129.17M total <small>(0.60M output)</small></span></li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>Help lists 60M input-token units weekly, including cached input, with model multipliers. New subscription terms exclude commercial products; signup availability requires checking.</p></div>
</div>
</details>
<details class="inference-plan-row">
<summary class="inference-plan-summary"><span class="inference-plan-name"><a href="https://kilo.ai/pricing/kilo-pass">Kilo Pass</a></span><span class="inference-plan-price">$19 / $49 / $199</span><span class="inference-plan-counts">371 models / variants · 3 calculations</span></summary>
<div class="inference-plan-details">
<div class="inference-plan-model-block"><p class="inference-plan-label">Supported models / catalog</p><ul class="inference-plan-models"><li>Anthropic: Claude Sonnet 5</li><li>Z.ai: GLM 5.3</li><li>MoonshotAI: Kimi K3</li><li>MiniMax: MiniMax M3</li><li>Z.ai: GLM 5.3 Flash</li><li>DeepSeek: DeepSeek V4 Pro 0813</li><li>DeepSeek: DeepSeek V4 Flash 0731</li><li>Xiaomi: MiMo-V2.5-Pro</li><li>Xiaomi: MiMo-V2.5</li></ul><p class="inference-plan-source">Showing 9 compared routes from 371 recorded models / variants. <a href="https://api.kilo.ai/api/gateway/models">Browse the complete catalog</a>.</p></div>
<div class="inference-plan-calculation-block"><p class="inference-plan-label">Estimated processed tokens / 30 days</p><ul class="inference-plan-calculations"><li><strong>Starter, Sonnet 5 annual</strong><span>91.59M total <small>(0.43M output)</small></span></li><li><strong>Pro, Sonnet 5 annual</strong><span>236.21M total <small>(1.10M output)</small></span></li><li><strong>Expert, Sonnet 5 annual</strong><span>959.32M total <small>(4.48M output)</small></span></li></ul></div>
<div class="inference-plan-limit-block"><p class="inference-plan-label">Allowance and practical limit</p><p>Credits plus welcome/loyalty bonuses; annual billing gives 50% extra monthly credits. Full use yields a 33.3% effective discount. Bonus credits expire monthly; Gateway supported.</p></div>
</div>
</details>
</div>

<!-- inference:plans:end -->

Several qualifications matter more than another decimal place in the price:

- **Z.ai supports specific coding tools and uses dynamic concurrency limits.** Its published examples include automated development tasks, but that does not establish unrestricted custom-backend access. [Usage policy](https://docs.z.ai/devpack/usage-policy)
- **camelStream's standard terms permit retention and training on prompts and outputs, without an opt-out.** Model choice, queue time and throughput are not guaranteed. It merits a small experiment with suitable non-sensitive work. [Terms](https://camelai.com/stream/terms)
- **Kimi Code's personal benefits differ from production API access.** The membership page alone does not establish a fixed Code token allowance or identical context limits across products. [Code benefits](https://www.kimi.ai/help/kimi-code/benefits)
- **NanoGPT's new subscription terms explicitly exclude building commercial products.** They apply to new users now and existing users from September 14. PAYG permits commercial use. [Terms](https://nano-gpt.com/legal/terms-of-service), [quota accounting](https://nano-gpt.com/help)
- **The DeepSeek reseller needs further clarification.** Its pricing cards and [DeepSeek integration page](https://deepseekv4pro.com/deepseek-token-plan) give different allowances. Its separate [Agent Plan documentation](https://deepseekv4pro.com/coding-plan-integration) describes an upstream Volcengine product. I have not treated either as an official DeepSeek subscription or assigned it a reliable savings multiplier.
- **Chutes' old unlimited-value anecdotes are obsolete.** Its [published revision](https://web.archive.org/web/20260712093051/https://chutes.ai/news/community-announcement-february) caps monthly subscription benefit at five times its own PAYG value and permits shorter rolling limits.

The [capacity CSV](/data/inference-plans/plan-capacity.csv) includes additional models, peak/off-peak variants and all four token buckets. The [catalog snapshot](/data/inference-plans/model-catalogs.json) preserves the large public model lists. Model availability, subscription inclusion and a selectable API alias are distinct; unresolved tier or alias details are marked in the comparison.

## Normalize the subscription costs

The same measured mix makes every quantifiable allowance comparable in token units: **1M billable output tokens requires approximately 213.167M input tokens, for 214.167M total processed tokens**. The input is divided among the fresh, cache-read and cache-write buckets above before applying each provider's prices or credit weights. Dividing a subscription's fee by its advertised credit count would skip that conversion.

```text
output_M = allowance_for_period / deductions_per_1M_output_and_its_input
processed_M = output_M × (1 + measured_input_output_ratio)
cost_per_1M_processed = fee_for_period / processed_M
cost_per_1M_output_with_input = fee_for_period / output_M
```

These are **fully utilized, steady-state 30-day estimates** from the dated September 7 price snapshot. Output costs include the associated input and cache processing; they are not the provider's output-only API rate. Processed-token costs include cache reads, which dominate this workload. Both measures describe the same workload and produce the same cost ordering. Differences in model quality still need an accepted-work benchmark.

<!-- inference:normalized:start -->

<div class="inference-record-list inference-normalized-list" role="region" aria-label="Normalized subscription costs">
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://opencode.ai/docs/go/">OpenCode Go: Go</a><span class="inference-record-subtitle">MiMo V2.5</span></span><span class="inference-record-metric"><strong>$0.32</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$10.00</dd></div><div><dt>Processed / 30 days</dt><dd>6.80B</dd></div><div><dt>Output / 30 days</dt><dd>31.73M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00147</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$0.32</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">83.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://opencode.ai/docs/go/">OpenCode Go: Go</a><span class="inference-record-subtitle">MiniMax M3</span></span><span class="inference-record-metric"><strong>$2.63</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$10.00</dd></div><div><dt>Processed / 30 days</dt><dd>815.16M</dd></div><div><dt>Output / 30 days</dt><dd>3.81M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01227</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$2.63</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://platform.minimax.io/docs/guides/pricing-paygo">83.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://opencode.ai/docs/go/">OpenCode Go: Go</a><span class="inference-record-subtitle">Kimi K3</span></span><span class="inference-record-metric"><strong>$65.94</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$10.00</dd></div><div><dt>Processed / 30 days</dt><dd>32.48M</dd></div><div><dt>Output / 30 days</dt><dd>0.15M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.30788</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$65.94</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://www.kimi.ai/resources/kimi-k3-pricing">33.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://synthetic.new/rate-limits">Synthetic: One pack</a><span class="inference-record-subtitle">GLM-5.3-Flash</span></span><span class="inference-record-metric"><strong>$2.87</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$30.00</dd></div><div><dt>Processed / 30 days</dt><dd>2.24B</dd></div><div><dt>Output / 30 days</dt><dd>10.45M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01340</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$2.87</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">63.1% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://synthetic.new/rate-limits">Synthetic: One pack</a><span class="inference-record-subtitle">Kimi-K3</span></span><span class="inference-record-metric"><strong>$37.85</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$30.00</dd></div><div><dt>Processed / 30 days</dt><dd>169.75M</dd></div><div><dt>Output / 30 days</dt><dd>0.79M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.17673</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$37.85</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://www.kimi.ai/resources/kimi-k3-pricing">61.7% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Lite</a><span class="inference-record-subtitle">MiMo V2.5 daytime</span></span><span class="inference-record-metric"><strong>$1.98</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$6.00</dd></div><div><dt>Processed / 30 days</dt><dd>650.12M</dd></div><div><dt>Output / 30 days</dt><dd>3.04M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00923</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.98</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">4.5% more expensive</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Standard</a><span class="inference-record-subtitle">MiMo V2.5 daytime</span></span><span class="inference-record-metric"><strong>$1.96</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$16.00</dd></div><div><dt>Processed / 30 days</dt><dd>1.74B</dd></div><div><dt>Output / 30 days</dt><dd>8.14M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00917</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.96</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">3.9% more expensive</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Pro</a><span class="inference-record-subtitle">MiMo V2.5 daytime</span></span><span class="inference-record-metric"><strong>$1.78</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$50.00</dd></div><div><dt>Processed / 30 days</dt><dd>6.03B</dd></div><div><dt>Output / 30 days</dt><dd>28.13M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00830</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.78</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">6.0% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Max</a><span class="inference-record-subtitle">MiMo V2.5 daytime</span></span><span class="inference-record-metric"><strong>$1.65</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$100.00</dd></div><div><dt>Processed / 30 days</dt><dd>13.00B</dd></div><div><dt>Output / 30 days</dt><dd>60.71M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00769</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.65</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">12.9% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://web.archive.org/web/20260712093051/https://chutes.ai/news/community-announcement-february">Chutes: Plus</a><span class="inference-record-subtitle">DeepSeek V4 Flash · conditional ceiling</span></span><span class="inference-record-metric"><strong>$2.73</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$10.00</dd></div><div><dt>Processed / 30 days</dt><dd>785.87M</dd></div><div><dt>Output / 30 days</dt><dd>3.67M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01272</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$2.73</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://api-docs.deepseek.com/quick_start/pricing/">26.9% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://web.archive.org/web/20260712093051/https://chutes.ai/news/community-announcement-february">Chutes: Pro</a><span class="inference-record-subtitle">DeepSeek V4 Flash · conditional ceiling</span></span><span class="inference-record-metric"><strong>$2.73</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$20.00</dd></div><div><dt>Processed / 30 days</dt><dd>1.57B</dd></div><div><dt>Output / 30 days</dt><dd>7.34M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01272</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$2.73</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://api-docs.deepseek.com/quick_start/pricing/">26.9% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://nano-gpt.com/help">NanoGPT: Pro</a><span class="inference-record-subtitle">Included model at 1x input weight</span></span><span class="inference-record-metric"><strong>$9.95</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$12.00</dd></div><div><dt>Processed / 30 days</dt><dd>258.35M</dd></div><div><dt>Output / 30 days</dt><dd>1.21M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.04645</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$9.95</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://nano-gpt.com/help">NanoGPT: Pro</a><span class="inference-record-subtitle">Included model at 2x input weight</span></span><span class="inference-record-metric"><strong>$19.90</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$12.00</dd></div><div><dt>Processed / 30 days</dt><dd>129.17M</dd></div><div><dt>Output / 30 days</dt><dd>0.60M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.09290</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$19.90</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://kilo.ai/pricing/kilo-pass">Kilo Pass: Starter annual billing</a><span class="inference-record-subtitle">Anthropic: Claude Sonnet 5</span></span><span class="inference-record-metric"><strong>$44.43</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$19.00</dd></div><div><dt>Processed / 30 days</dt><dd>91.59M</dd></div><div><dt>Output / 30 days</dt><dd>0.43M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.20744</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$44.43</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://kilo.ai/pricing/kilo-pass">Kilo Pass: Pro annual billing</a><span class="inference-record-subtitle">Anthropic: Claude Sonnet 5</span></span><span class="inference-record-metric"><strong>$44.43</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$49.00</dd></div><div><dt>Processed / 30 days</dt><dd>236.21M</dd></div><div><dt>Output / 30 days</dt><dd>1.10M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.20744</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$44.43</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://kilo.ai/pricing/kilo-pass">Kilo Pass: Expert annual billing</a><span class="inference-record-subtitle">Anthropic: Claude Sonnet 5</span></span><span class="inference-record-metric"><strong>$44.43</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$199.00</dd></div><div><dt>Processed / 30 days</dt><dd>959.32M</dd></div><div><dt>Output / 30 days</dt><dd>4.48M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.20744</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$44.43</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Lite</a><span class="inference-record-subtitle">GLM-5.3 (off-peak)</span></span><span class="inference-record-metric"><strong>$8.92</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$18.00</dd></div><div><dt>Processed / 30 days</dt><dd>432.12M</dd></div><div><dt>Output / 30 days</dt><dd>2.02M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.04166</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$8.92</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">86.9% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Pro</a><span class="inference-record-subtitle">GLM-5.3 (off-peak)</span></span><span class="inference-record-metric"><strong>$6.61</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$80.00</dd></div><div><dt>Processed / 30 days</dt><dd>2.59B</dd></div><div><dt>Output / 30 days</dt><dd>12.11M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.03086</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$6.61</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">90.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Max</a><span class="inference-record-subtitle">GLM-5.3 (off-peak)</span></span><span class="inference-record-metric"><strong>$5.95</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$168.00</dd></div><div><dt>Processed / 30 days</dt><dd>6.05B</dd></div><div><dt>Output / 30 days</dt><dd>28.25M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.02777</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$5.95</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">91.3% less</a></dd></div></dl></div>
</details>
</div>

<!-- inference:normalized:end -->

The comparison covers the quantifiable examples from the plan overview. Other model allocations and time windows use the same calculation:

<details>
<summary>Show the remaining model and time-of-day calculations</summary>

<!-- inference:normalized-other:start -->

<div class="inference-record-list inference-normalized-list" role="region" aria-label="Additional normalized subscription costs">
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://opencode.ai/docs/go/">OpenCode Go: Go</a><span class="inference-record-subtitle">DeepSeek V4 Flash off-peak</span></span><span class="inference-record-metric"><strong>$1.24</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$10.00</dd></div><div><dt>Processed / 30 days</dt><dd>1.72B</dd></div><div><dt>Output / 30 days</dt><dd>8.05M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00580</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.24</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://api-docs.deepseek.com/quick_start/pricing/">66.7% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://opencode.ai/docs/go/">OpenCode Go: Go</a><span class="inference-record-subtitle">GLM-5.3</span></span><span class="inference-record-metric"><strong>$45.50</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$10.00</dd></div><div><dt>Processed / 30 days</dt><dd>47.07M</dd></div><div><dt>Output / 30 days</dt><dd>0.22M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.21245</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$45.50</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">33.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://opencode.ai/docs/go/">OpenCode Go: Go</a><span class="inference-record-subtitle">GPT-5.6 Luna</span></span><span class="inference-record-metric"><strong>$4.58</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$10.00</dd></div><div><dt>Processed / 30 days</dt><dd>468.02M</dd></div><div><dt>Output / 30 days</dt><dd>2.19M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.02137</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$4.58</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://synthetic.new/rate-limits">Synthetic: One pack</a><span class="inference-record-subtitle">gpt-oss-120b</span></span><span class="inference-record-metric"><strong>$1.45</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$30.00</dd></div><div><dt>Processed / 30 days</dt><dd>4.45B</dd></div><div><dt>Output / 30 days</dt><dd>20.76M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00675</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.45</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://synthetic.new/rate-limits">Synthetic: One pack</a><span class="inference-record-subtitle">GLM-5.2</span></span><span class="inference-record-metric"><strong>$12.63</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$30.00</dd></div><div><dt>Processed / 30 days</dt><dd>508.57M</dd></div><div><dt>Output / 30 days</dt><dd>2.37M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.05899</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$12.63</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://synthetic.new/rate-limits">Synthetic: One pack</a><span class="inference-record-subtitle">Qwen3.8-27B</span></span><span class="inference-record-metric"><strong>$7.01</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$30.00</dd></div><div><dt>Processed / 30 days</dt><dd>916.11M</dd></div><div><dt>Output / 30 days</dt><dd>4.28M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.03275</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$7.01</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://synthetic.new/rate-limits">Synthetic: One pack</a><span class="inference-record-subtitle">GLM-4.7-Flash</span></span><span class="inference-record-metric"><strong>$1.56</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$30.00</dd></div><div><dt>Processed / 30 days</dt><dd>4.11B</dd></div><div><dt>Output / 30 days</dt><dd>19.21M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00729</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.56</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://synthetic.new/rate-limits">Synthetic: One pack</a><span class="inference-record-subtitle">NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4</span></span><span class="inference-record-metric"><strong>$4.54</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$30.00</dd></div><div><dt>Processed / 30 days</dt><dd>1.42B</dd></div><div><dt>Output / 30 days</dt><dd>6.61M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.02120</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$4.54</strong></dd></div><div><dt>Saving vs direct API</dt><dd>Not established</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Lite</a><span class="inference-record-subtitle">MiMo V2.5 off-peak</span></span><span class="inference-record-metric"><strong>$1.58</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$6.00</dd></div><div><dt>Processed / 30 days</dt><dd>812.66M</dd></div><div><dt>Output / 30 days</dt><dd>3.79M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00738</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.58</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">16.4% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Lite</a><span class="inference-record-subtitle">MiMo V2.5 Pro daytime</span></span><span class="inference-record-metric"><strong>$4.88</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$6.00</dd></div><div><dt>Processed / 30 days</dt><dd>263.55M</dd></div><div><dt>Output / 30 days</dt><dd>1.23M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.02277</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$4.88</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">1.0% more expensive</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Lite</a><span class="inference-record-subtitle">MiMo V2.5 Pro off-peak</span></span><span class="inference-record-metric"><strong>$3.90</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$6.00</dd></div><div><dt>Processed / 30 days</dt><dd>329.44M</dd></div><div><dt>Output / 30 days</dt><dd>1.54M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01821</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$3.90</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">19.2% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Standard</a><span class="inference-record-subtitle">MiMo V2.5 off-peak</span></span><span class="inference-record-metric"><strong>$1.57</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$16.00</dd></div><div><dt>Processed / 30 days</dt><dd>2.18B</dd></div><div><dt>Output / 30 days</dt><dd>10.18M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00734</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.57</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">16.9% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Standard</a><span class="inference-record-subtitle">MiMo V2.5 Pro daytime</span></span><span class="inference-record-metric"><strong>$4.85</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$16.00</dd></div><div><dt>Processed / 30 days</dt><dd>707.10M</dd></div><div><dt>Output / 30 days</dt><dd>3.30M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.02263</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$4.85</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">0.4% more expensive</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Standard</a><span class="inference-record-subtitle">MiMo V2.5 Pro off-peak</span></span><span class="inference-record-metric"><strong>$3.88</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$16.00</dd></div><div><dt>Processed / 30 days</dt><dd>883.87M</dd></div><div><dt>Output / 30 days</dt><dd>4.13M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01810</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$3.88</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">19.7% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Pro</a><span class="inference-record-subtitle">MiMo V2.5 off-peak</span></span><span class="inference-record-metric"><strong>$1.42</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$50.00</dd></div><div><dt>Processed / 30 days</dt><dd>7.53B</dd></div><div><dt>Output / 30 days</dt><dd>35.17M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00664</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.42</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">24.8% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Pro</a><span class="inference-record-subtitle">MiMo V2.5 Pro daytime</span></span><span class="inference-record-metric"><strong>$4.38</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$50.00</dd></div><div><dt>Processed / 30 days</dt><dd>2.44B</dd></div><div><dt>Output / 30 days</dt><dd>11.41M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.02047</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$4.38</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">9.2% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Pro</a><span class="inference-record-subtitle">MiMo V2.5 Pro off-peak</span></span><span class="inference-record-metric"><strong>$3.51</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$50.00</dd></div><div><dt>Processed / 30 days</dt><dd>3.05B</dd></div><div><dt>Output / 30 days</dt><dd>14.26M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01638</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$3.51</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">27.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Max</a><span class="inference-record-subtitle">MiMo V2.5 off-peak</span></span><span class="inference-record-metric"><strong>$1.32</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$100.00</dd></div><div><dt>Processed / 30 days</dt><dd>16.25B</dd></div><div><dt>Output / 30 days</dt><dd>75.89M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00615</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.32</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">30.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Max</a><span class="inference-record-subtitle">MiMo V2.5 Pro daytime</span></span><span class="inference-record-metric"><strong>$4.06</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$100.00</dd></div><div><dt>Processed / 30 days</dt><dd>5.27B</dd></div><div><dt>Output / 30 days</dt><dd>24.61M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01897</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$4.06</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">15.8% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan: Max</a><span class="inference-record-subtitle">MiMo V2.5 Pro off-peak</span></span><span class="inference-record-metric"><strong>$3.25</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$100.00</dd></div><div><dt>Processed / 30 days</dt><dd>6.59B</dd></div><div><dt>Output / 30 days</dt><dd>30.77M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01518</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$3.25</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">32.6% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://kilo.ai/pricing/kilo-pass">Kilo Pass: Starter annual billing</a><span class="inference-record-subtitle">MiniMax: MiniMax M3</span></span><span class="inference-record-metric"><strong>$10.51</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$19.00</dd></div><div><dt>Processed / 30 days</dt><dd>387.20M</dd></div><div><dt>Output / 30 days</dt><dd>1.81M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.04907</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$10.51</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://platform.minimax.io/docs/guides/pricing-paygo">33.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://kilo.ai/pricing/kilo-pass">Kilo Pass: Pro annual billing</a><span class="inference-record-subtitle">MiniMax: MiniMax M3</span></span><span class="inference-record-metric"><strong>$10.51</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$49.00</dd></div><div><dt>Processed / 30 days</dt><dd>998.57M</dd></div><div><dt>Output / 30 days</dt><dd>4.66M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.04907</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$10.51</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://platform.minimax.io/docs/guides/pricing-paygo">33.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://kilo.ai/pricing/kilo-pass">Kilo Pass: Expert annual billing</a><span class="inference-record-subtitle">MiniMax: MiniMax M3</span></span><span class="inference-record-metric"><strong>$10.51</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$199.00</dd></div><div><dt>Processed / 30 days</dt><dd>4.06B</dd></div><div><dt>Output / 30 days</dt><dd>18.94M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.04907</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$10.51</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://platform.minimax.io/docs/guides/pricing-paygo">33.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Lite</a><span class="inference-record-subtitle">GLM-5.3 (peak)</span></span><span class="inference-record-metric"><strong>$17.84</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$18.00</dd></div><div><dt>Processed / 30 days</dt><dd>216.06M</dd></div><div><dt>Output / 30 days</dt><dd>1.01M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.08331</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$17.84</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">73.9% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Lite</a><span class="inference-record-subtitle">GLM-5.3-Flash list (off-peak)</span></span><span class="inference-record-metric"><strong>$2.94</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$18.00</dd></div><div><dt>Processed / 30 days</dt><dd>1.31B</dd></div><div><dt>Output / 30 days</dt><dd>6.11M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01375</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$2.94</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">62.2% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Lite</a><span class="inference-record-subtitle">GLM-5.3-Flash list (peak)</span></span><span class="inference-record-metric"><strong>$5.89</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$18.00</dd></div><div><dt>Processed / 30 days</dt><dd>654.52M</dd></div><div><dt>Output / 30 days</dt><dd>3.06M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.02750</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$5.89</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">24.3% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Pro</a><span class="inference-record-subtitle">GLM-5.3 (peak)</span></span><span class="inference-record-metric"><strong>$13.22</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$80.00</dd></div><div><dt>Processed / 30 days</dt><dd>1.30B</dd></div><div><dt>Output / 30 days</dt><dd>6.05M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.06171</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$13.22</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">80.6% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Pro</a><span class="inference-record-subtitle">GLM-5.3-Flash list (off-peak)</span></span><span class="inference-record-metric"><strong>$2.18</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$80.00</dd></div><div><dt>Processed / 30 days</dt><dd>7.85B</dd></div><div><dt>Output / 30 days</dt><dd>36.67M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01019</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$2.18</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">72.0% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Pro</a><span class="inference-record-subtitle">GLM-5.3-Flash list (peak)</span></span><span class="inference-record-metric"><strong>$4.36</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$80.00</dd></div><div><dt>Processed / 30 days</dt><dd>3.93B</dd></div><div><dt>Output / 30 days</dt><dd>18.34M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.02037</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$4.36</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">43.9% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Max</a><span class="inference-record-subtitle">GLM-5.3 (peak)</span></span><span class="inference-record-metric"><strong>$11.89</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$168.00</dd></div><div><dt>Processed / 30 days</dt><dd>3.02B</dd></div><div><dt>Output / 30 days</dt><dd>14.12M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.05554</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$11.89</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">82.6% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Max</a><span class="inference-record-subtitle">GLM-5.3-Flash list (off-peak)</span></span><span class="inference-record-metric"><strong>$1.96</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$168.00</dd></div><div><dt>Processed / 30 days</dt><dd>18.33B</dd></div><div><dt>Output / 30 days</dt><dd>85.57M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.00917</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$1.96</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">74.8% less</a></dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/devpack/overview">Z.ai Lite / Pro / Max: Max</a><span class="inference-record-subtitle">GLM-5.3-Flash list (peak)</span></span><span class="inference-record-metric"><strong>$3.93</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Fee / month</dt><dd>$168.00</dd></div><div><dt>Processed / 30 days</dt><dd>9.16B</dd></div><div><dt>Output / 30 days</dt><dd>42.79M</dd></div><div><dt>$ / 1M processed</dt><dd>$0.01833</dd></div><div><dt>$ / 1M output + its input</dt><dd><strong>$3.93</strong></dd></div><div><dt>Saving vs direct API</dt><dd><a href="https://docs.z.ai/guides/overview/pricing">49.5% less</a></dd></div></dl></div>
</details>
</div>

<!-- inference:normalized-other:end -->

</details>

“Saving vs direct API” compares the same named model against the direct API row below, using ordinary list prices for GLM Flash and off-peak prices for DeepSeek. Serving configurations and cache behavior can differ. “Not established” means this dataset lacks a defensible same-model baseline; it does not mean zero savings. Chutes estimates remain conditional on its published ceiling and model eligibility. Kilo examples assume annual billing with the full monthly bonus consumed before expiry. Alternative model allocations within a subscription cannot be added together.

The [capacity CSV](/data/inference-plans/plan-capacity.csv) contains all four token buckets, both normalized costs, direct API savings and break-even utilization. It also separates a discount against the serving provider's own PAYG rates from a discount against the original model API. Missing or conflicting quotas remain blank; camelStream's unmetered service has no defensible fixed token capacity or normalized cost here. MiniMax, Kimi and the DeepSeek reseller need quota clarification; Alibaba needs tokens per billable request.

At **50% utilization, each subscription's effective cost per token doubles**. Break-even utilization is the fraction of modeled allowance that must replace direct API spending to recover the fee. A figure above 100% means even full utilization is more expensive than that API baseline. Real concurrency, request and reset limits can prevent reaching the modeled allowance.

## Start with the API baseline

The priced workload is **1M billable output tokens plus the measured proportions of fresh input, cache reads and cache writes shown above**. Tokenizers differ, so equal token counts do not mean identical amounts of source code. These are estimates at current prices, not the historical cash cost of the measured sessions.

For prices stated per million tokens:

```text
cost = fresh_input_M × input_price
     + cache_read_M × cache_read_price
     + cache_write_M × cache_creation_price
     + output_M × output_price
     + additional_charges
```

The comparison excludes paid tools, search, additional retries, infrastructure and long-context premiums. Cache creation uses the ordinary input price unless the serving provider specifies a separate full creation rate. Free cache storage or a waived write surcharge does not make the initial input processing free. Kilo's Sonnet 5 example, for instance, uses its explicit cache-creation rate in the capacity calculator.

<!-- inference:api:start -->

<div class="inference-record-list inference-api-list" role="region" aria-label="Direct API prices">
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">MiMo V2.5</a></span><span class="inference-record-metric"><strong>$1.89</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$0.14</dd></div><div><dt>Cached / M</dt><dd>$0.0028</dd></div><div><dt>Output / M</dt><dd>$0.28</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$1.89</strong></dd></div><div><dt>$100 processed capacity</dt><dd>11.33B total (52.88M output)</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://api-docs.deepseek.com/quick_start/pricing/">DeepSeek V4 Flash off-peak</a></span><span class="inference-record-metric"><strong>$3.73</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$0.22</dd></div><div><dt>Cached / M</dt><dd>$0.007</dd></div><div><dt>Output / M</dt><dd>$0.66</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$3.73</strong></dd></div><div><dt>$100 processed capacity</dt><dd>5.75B total (26.84M output)</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/guides/overview/pricing">GLM-5.3-Flash promotional</a></span><span class="inference-record-metric"><strong>$3.89</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$0.075</dd></div><div><dt>Cached / M</dt><dd>$0.015</dd></div><div><dt>Output / M</dt><dd>$0.25</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$3.89</strong></dd></div><div><dt>$100 processed capacity</dt><dd>5.50B total (25.70M output)</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/pay-as-you-go">MiMo V2.5 Pro</a></span><span class="inference-record-metric"><strong>$4.83</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$0.435</dd></div><div><dt>Cached / M</dt><dd>$0.0036</dd></div><div><dt>Output / M</dt><dd>$0.87</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$4.83</strong></dd></div><div><dt>$100 processed capacity</dt><dd>4.44B total (20.72M output)</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/guides/overview/pricing">GLM-5.3-Flash list</a></span><span class="inference-record-metric"><strong>$7.78</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$0.15</dd></div><div><dt>Cached / M</dt><dd>$0.03</dd></div><div><dt>Output / M</dt><dd>$0.50</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$7.78</strong></dd></div><div><dt>$100 processed capacity</dt><dd>2.75B total (12.85M output)</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://api-docs.deepseek.com/quick_start/pricing/">DeepSeek V4 Pro off-peak</a></span><span class="inference-record-metric"><strong>$11.39</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$0.66</dd></div><div><dt>Cached / M</dt><dd>$0.022</dd></div><div><dt>Output / M</dt><dd>$1.98</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$11.39</strong></dd></div><div><dt>$100 processed capacity</dt><dd>1.88B total (8.78M output)</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://platform.minimax.io/docs/guides/pricing-paygo">MiniMax M3</a></span><span class="inference-record-metric"><strong>$15.76</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$0.3</dd></div><div><dt>Cached / M</dt><dd>$0.06</dd></div><div><dt>Output / M</dt><dd>$1.20</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$15.76</strong></dd></div><div><dt>$100 processed capacity</dt><dd>1.36B total (6.34M output)</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://docs.z.ai/guides/overview/pricing">GLM-5.3</a></span><span class="inference-record-metric"><strong>$68.25</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$1.4</dd></div><div><dt>Cached / M</dt><dd>$0.26</dd></div><div><dt>Output / M</dt><dd>$4.40</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$68.25</strong></dd></div><div><dt>$100 processed capacity</dt><dd>313.80M total (1.47M output)</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://www.kimi.ai/resources/kimi-k3-pricing">Kimi K3</a></span><span class="inference-record-metric"><strong>$98.91</strong><small> / 1M output</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Input / M</dt><dd>$3</dd></div><div><dt>Cached / M</dt><dd>$0.3</dd></div><div><dt>Output / M</dt><dd>$15.00</dd></div><div><dt>Cost per 1M output + its input</dt><dd><strong>$98.91</strong></dd></div><div><dt>$100 processed capacity</dt><dd>216.54M total (1.01M output)</dd></div></dl></div>
</details>
</div>

<!-- inference:api:end -->

Without cache hits, the same workload costs **$30.12 on MiMo V2.5**, **$47.56 on off-peak DeepSeek Flash**, and **$654.50 on Kimi K3**. A plan that counts cached input at full token weight can lose much of its advantage against an API with inexpensive cache reads. Repeated context also inflates token totals without representing newly generated work.

DeepSeek's listed prices apply outside weekday peak windows of **01:00–04:00 and 06:00–10:00 UTC**; peak rates double. MiniMax M3's listed rate applies through 512K input per request. These timing and context conditions belong in the comparison, not in a footnote to the invoice. [DeepSeek pricing](https://api-docs.deepseek.com/quick_start/pricing/), [MiniMax pricing](https://platform.minimax.io/docs/guides/pricing-paygo)

## Compare with OpenRouter too

OpenRouter narrows some subscription discounts because its alternative providers can undercut the model author's API. The result depends heavily on cached-input pricing. The following snapshot was captured on **September 7, 2026, through 16:11 UTC** from OpenRouter's public model-endpoint API. Each quote keeps one provider's input, cache and output rates together.

The comparison is grouped by **subscription, then model, then tier or time window**. All twelve researched coding subscriptions appear, including those with unknown costs. Models from the saved catalogs remain visible in the index; large unpriced catalogs expand underneath their subscription. Catalog presence, subscription eligibility and model pinning are separate questions, so each group retains those conditions. Native workflow subscriptions are discussed separately below.

The unit-cost fields report **cash cost per 1M output tokens plus 213.167M associated input tokens**, using the measured cache mix. Subscription summaries show the monthly fee, and capacity details show total processed tokens with output in parentheses. Each calculated scenario spends the full allowance on its named model; scenarios within one subscription are alternative allocations. “Not established” means the snapshot lacks a defensible entitlement or calculation; “Not quoted” means no matching OpenRouter route was priced.

OpenRouter figures include its standard card-purchase fee: **5.5%, with a $0.80 minimum**. The reference purchase is $100 of inference credits plus $5.50 in fees, so quoted inference cost is multiplied by 1.055 once. A $10 credit purchase instead incurs an 8% effective fee. Taxes and special billing arrangements are excluded. [OpenRouter fee policy](https://openrouter.ai/blog/insights/governing-team-ai-spend/)

<!-- inference:openrouter:start -->

<div class="inference-subscription-index" role="region" aria-label="OpenRouter and subscription comparison">
<p class="inference-jump-links">Jump to subscription: <a href="#inference-plan-opencode-go">OpenCode Go</a> · <a href="#inference-plan-z-ai-lite-pro-max">Z.ai Lite / Pro / Max</a> · <a href="#inference-plan-synthetic">Synthetic</a> · <a href="#inference-plan-camelstream">camelStream</a> · <a href="#inference-plan-minimax-token-plan">MiniMax Token Plan</a> · <a href="#inference-plan-kimi-membership-code">Kimi membership / Code</a> · <a href="#inference-plan-alibaba-cloud-coding-plan">Alibaba Cloud Coding Plan</a> · <a href="#inference-plan-deepseekv4pro-com">deepseekv4pro.com</a> · <a href="#inference-plan-mimo-token-plan">MiMo Token Plan</a> · <a href="#inference-plan-chutes">Chutes</a> · <a href="#inference-plan-nanogpt">NanoGPT</a> · <a href="#inference-plan-kilo-pass">Kilo Pass</a></p>
<details class="inference-subscription-record" id="inference-plan-opencode-go" data-subscription="OpenCode Go">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://opencode.ai/docs/go/">OpenCode Go</a><span class="inference-record-subtitle"><a href="https://opencode.ai/docs/go/">27 recorded models / aliases</a></span></span><span class="inference-record-metric">$10 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">One shared allowance. Regional and experimental conditions apply; uncalculated models retain unknown capacity.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="MiMo V2.5">
<summary class="inference-record-summary"><span class="inference-record-title">MiMo V2.5</span><span class="inference-record-metric">$0.32 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="go-mimo"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>6.80B (31.73M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$0.32</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>84.2% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="MiniMax M3">
<summary class="inference-record-summary"><span class="inference-record-title">MiniMax M3</span><span class="inference-record-metric">$2.63 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="go-m3"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>815.16M (3.81M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$2.63</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/minimax/minimax-m3/endpoints">$15.50</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>83.1% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Kimi K3">
<summary class="inference-record-summary"><span class="inference-record-title">Kimi K3</span><span class="inference-record-metric">$65.94 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="go-k3"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>32.48M (0.15M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$65.94</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/moonshotai/kimi-k3/endpoints">$96.95</a><span class="inference-fact-note">Sail Research, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>32.0% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="DeepSeek V4 Flash">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek V4 Flash</span><span class="inference-record-metric">$1.24 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="go-flash"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>1.72B (8.05M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.24</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-flash-0731/endpoints">$2.36</a><span class="inference-fact-note">StreamLake, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>47.3% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GLM-5.3">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.3</span><span class="inference-record-metric">$45.50 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="go-glm"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>47.07M (0.22M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$45.50</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>1.0% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GPT-5.6 Luna">
<summary class="inference-record-summary"><span class="inference-record-title">GPT-5.6 Luna</span><span class="inference-record-metric">$4.58 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="go-luna"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>468.02M (2.19M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$4.58</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="MiMo V2.5 Pro">
<summary class="inference-record-summary"><span class="inference-record-title">MiMo V2.5 Pro</span><span class="inference-record-metric">$21.21 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GLM-5.3-Flash">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.3-Flash</span><span class="inference-record-metric">$3.90 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="DeepSeek V4 Pro">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek V4 Pro</span><span class="inference-record-metric">$12.01 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-0813/endpoints">$12.01</a><span class="inference-fact-note">DeepSeek</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Grok 4.6">
<summary class="inference-record-summary"><span class="inference-record-title">Grok 4.6</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GLM-5.2">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.2</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GLM-5.1">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.1</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Kimi K2.7 Code">
<summary class="inference-record-summary"><span class="inference-record-title">Kimi K2.7 Code</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Kimi K2.6">
<summary class="inference-record-summary"><span class="inference-record-title">Kimi K2.6</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="MiniMax M2.7">
<summary class="inference-record-summary"><span class="inference-record-title">MiniMax M2.7</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen 3.8 Max">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen 3.8 Max</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen 3.8 Flash">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen 3.8 Flash</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen 3.7 Max">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen 3.7 Max</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen 3.7 Plus">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen 3.7 Plus</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen 3.6 Plus">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen 3.6 Plus</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="LongCat 2.0">
<summary class="inference-record-summary"><span class="inference-record-title">LongCat 2.0</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Muse Spark 1.3 Contributor">
<summary class="inference-record-summary"><span class="inference-record-title">Muse Spark 1.3 Contributor</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Muse Spark 1.2 Contributor">
<summary class="inference-record-summary"><span class="inference-record-title">Muse Spark 1.2 Contributor</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="DeepSeek V4 Flash Vision Exp">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek V4 Flash Vision Exp</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Hy4">
<summary class="inference-record-summary"><span class="inference-record-title">Hy4</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Hy3">
<summary class="inference-record-summary"><span class="inference-record-title">Hy3</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Omen Alpha">
<summary class="inference-record-summary"><span class="inference-record-title">Omen Alpha</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Go</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-z-ai-lite-pro-max" data-subscription="Z.ai Lite / Pro / Max">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://z.ai/subscribe">Z.ai Lite / Pro / Max</a><span class="inference-record-subtitle"><a href="https://docs.z.ai/devpack/overview">2 recorded models / aliases</a></span></span><span class="inference-record-metric">$18 / $80 / $168 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Older aliases route to these models. Each row allocates the entire tier allowance to one model and time window.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="GLM-5.3">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.3</span><span class="inference-record-metric">6 scenarios</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="zai-lite-glm-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Lite; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>432.12M (2.02M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$8.92</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>80.6% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-lite-glm-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Lite; peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>216.06M (1.01M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$17.84</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>61.2% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-pro-glm-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>2.59B (12.11M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$6.61</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>85.6% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-pro-glm-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>1.30B (6.05M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$13.22</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>71.2% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-max-glm-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Max; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>6.05B (28.25M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$5.95</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>87.1% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-max-glm-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Max; peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>3.02B (14.12M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$11.89</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>74.1% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GLM-5.3-Flash">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.3-Flash</span><span class="inference-record-metric">6 scenarios</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="zai-lite-flash-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Lite; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>1.31B (6.11M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$2.94</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>24.5% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-lite-flash-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Lite; peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>654.52M (3.06M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$5.89</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>51.0% more expensive</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-pro-flash-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>7.85B (36.67M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$2.18</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>44.1% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-pro-flash-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>3.93B (18.34M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$4.36</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>11.9% more expensive</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-max-flash-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Max; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>18.33B (85.57M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.96</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>49.7% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="zai-max-flash-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Max; peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>9.16B (42.79M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$3.93</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>0.7% more expensive</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-synthetic" data-subscription="Synthetic">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://synthetic.new/rate-limits">Synthetic</a><span class="inference-record-subtitle"><a href="https://api.synthetic.new/openai/v1/models">11 recorded models / aliases</a></span></span><span class="inference-record-metric">$30 per pack / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">The saved served catalog includes four automatic aliases. Catalog availability alone does not establish subscription eligibility.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="syn:large:text">
<summary class="inference-record-summary"><span class="inference-record-title">syn:large:text</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="syn:small:text">
<summary class="inference-record-summary"><span class="inference-record-title">syn:small:text</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="syn:large:vision">
<summary class="inference-record-summary"><span class="inference-record-title">syn:large:vision</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="syn:small:vision">
<summary class="inference-record-summary"><span class="inference-record-title">syn:small:vision</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="hf:openai/gpt-oss-120b">
<summary class="inference-record-summary"><span class="inference-record-title">openai/gpt-oss-120b</span><span class="inference-record-metric">$1.45 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="synthetic-gpt-oss-120b"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One pack</dd></div><div><dt>Processed / 30 days (output)</dt><dd>4.45B (20.76M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.45</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="hf:zai-org/GLM-5.3-Flash">
<summary class="inference-record-summary"><span class="inference-record-title">zai-org/GLM-5.3-Flash</span><span class="inference-record-metric">$2.87 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="synthetic-glm-5.3-flash"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One pack</dd></div><div><dt>Processed / 30 days (output)</dt><dd>2.24B (10.45M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$2.87</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>26.4% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="hf:zai-org/GLM-5.2">
<summary class="inference-record-summary"><span class="inference-record-title">zai-org/GLM-5.2</span><span class="inference-record-metric">$12.63 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="synthetic-glm-5.2"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One pack</dd></div><div><dt>Processed / 30 days (output)</dt><dd>508.57M (2.37M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$12.63</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="hf:moonshotai/Kimi-K3">
<summary class="inference-record-summary"><span class="inference-record-title">moonshotai/Kimi-K3</span><span class="inference-record-metric">$37.85 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="synthetic-kimi-k3"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One pack</dd></div><div><dt>Processed / 30 days (output)</dt><dd>169.75M (0.79M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$37.85</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/moonshotai/kimi-k3/endpoints">$96.95</a><span class="inference-fact-note">Sail Research, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>61.0% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="hf:Qwen/Qwen3.8-27B">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen/Qwen3.8-27B</span><span class="inference-record-metric">$7.01 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="synthetic-qwen3.8-27b"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One pack</dd></div><div><dt>Processed / 30 days (output)</dt><dd>916.11M (4.28M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$7.01</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="hf:zai-org/GLM-4.7-Flash">
<summary class="inference-record-summary"><span class="inference-record-title">zai-org/GLM-4.7-Flash</span><span class="inference-record-metric">$1.56 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="synthetic-glm-4.7-flash"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One pack</dd></div><div><dt>Processed / 30 days (output)</dt><dd>4.11B (19.21M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.56</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="hf:nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4">
<summary class="inference-record-summary"><span class="inference-record-title">nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4</span><span class="inference-record-metric">$4.54 subscription</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="synthetic-nvidia-nemotron-3-super-120b-a12b-nvfp4"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One pack</dd></div><div><dt>Processed / 30 days (output)</dt><dd>1.42B (6.61M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$4.54</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-camelstream" data-subscription="camelStream">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://camelai.com/pricing">camelStream</a><span class="inference-record-subtitle"><a href="https://camelai.com/docs/stream/fleet">5 recorded models / aliases</a></span></span><span class="inference-record-metric">$5 per stream / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Unmetered service has no fixed token entitlement. Named routes are possible automatic choices, not selectable allocations.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="DeepSeek V4 Flash">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek V4 Flash</span><span class="inference-record-metric">$2.36 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="camel-unmetered"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One stream; automatic routing, no model pinning</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Unmetered; throughput unknown</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-flash-0731/endpoints">$2.36</a><span class="inference-fact-note">StreamLake, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Gemini 3.7 Flash">
<summary class="inference-record-summary"><span class="inference-record-title">Gemini 3.7 Flash</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="camel-unmetered"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One stream; automatic routing, no model pinning</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Unmetered; throughput unknown</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GLM-5.3-Flash">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.3-Flash</span><span class="inference-record-metric">$3.90 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="camel-unmetered"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One stream; automatic routing, no model pinning</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Unmetered; throughput unknown</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GPT-5.6 Luna">
<summary class="inference-record-summary"><span class="inference-record-title">GPT-5.6 Luna</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="camel-unmetered"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One stream; automatic routing, no model pinning</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Unmetered; throughput unknown</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Muse Spark 1.2">
<summary class="inference-record-summary"><span class="inference-record-title">Muse Spark 1.2</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="camel-unmetered"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>One stream; automatic routing, no model pinning</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Unmetered; throughput unknown</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-minimax-token-plan" data-subscription="MiniMax Token Plan">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://platform.minimax.io/docs/guides/pricing-token-plan">MiniMax Token Plan</a><span class="inference-record-subtitle"><a href="https://platform.minimax.io/docs/guides/pricing-token-plan">2 recorded models / aliases</a></span></span><span class="inference-record-metric">$22 / $55 / $132 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Text models only. Image and speech share quota but are outside this token comparison; published numerical allowance is insufficient.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="MiniMax M3">
<summary class="inference-record-summary"><span class="inference-record-title">MiniMax M3</span><span class="inference-record-metric">$15.50 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="minimax-unknown"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/minimax/minimax-m3/endpoints">$15.50</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="MiniMax M2.7">
<summary class="inference-record-summary"><span class="inference-record-title">MiniMax M2.7</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="minimax-unknown"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-kimi-membership-code" data-subscription="Kimi membership / Code">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://www.kimi.ai/resources/kimi-k3-pricing">Kimi membership / Code</a><span class="inference-record-subtitle"><a href="https://www.kimi.ai/help/kimi-code/third-party-agents">3 recorded models / aliases</a></span></span><span class="inference-record-metric">$19 / $39 / $99 / $199 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">No fixed comparable entitlement established. Membership K3 and Code aliases are distinguished; alias costs are not assumed to equal K3.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="Kimi K3">
<summary class="inference-record-summary"><span class="inference-record-title">Kimi K3</span><span class="inference-record-metric">$96.95 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="kimi-unknown"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Membership; K3 advertised across Kimi</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/moonshotai/kimi-k3/endpoints">$96.95</a><span class="inference-fact-note">Sail Research, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="kimi-for-coding">
<summary class="inference-record-summary"><span class="inference-record-title">kimi-for-coding</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="kimi-unknown"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Code alias; backing version not pinned</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="kimi-for-coding-highspeed">
<summary class="inference-record-summary"><span class="inference-record-title">kimi-for-coding-highspeed</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="kimi-unknown"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Code HighSpeed alias; Allegretto+; backing version not pinned</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-alibaba-cloud-coding-plan" data-subscription="Alibaba Cloud Coding Plan">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://www.alibabacloud.com/help/en/model-studio/coding-plan">Alibaba Cloud Coding Plan</a><span class="inference-record-subtitle"><a href="https://www.alibabacloud.com/help/en/model-studio/coding-plan">10 recorded models / aliases</a></span></span><span class="inference-record-metric">$50 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Request quotas cannot be converted without tokens per billable request. Automated scripts and application backends are excluded.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="qwen3.7-plus">
<summary class="inference-record-summary"><span class="inference-record-title">qwen3.7-plus</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="qwen3.6-plus">
<summary class="inference-record-summary"><span class="inference-record-title">qwen3.6-plus</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="kimi-k2.5">
<summary class="inference-record-summary"><span class="inference-record-title">kimi-k2.5</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="glm-5">
<summary class="inference-record-summary"><span class="inference-record-title">glm-5</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="MiniMax-M2.5">
<summary class="inference-record-summary"><span class="inference-record-title">MiniMax-M2.5</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="qwen3.5-plus">
<summary class="inference-record-summary"><span class="inference-record-title">qwen3.5-plus</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="qwen3-max-2026-01-23">
<summary class="inference-record-summary"><span class="inference-record-title">qwen3-max-2026-01-23</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="qwen3-coder-next">
<summary class="inference-record-summary"><span class="inference-record-title">qwen3-coder-next</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="qwen3-coder-plus">
<summary class="inference-record-summary"><span class="inference-record-title">qwen3-coder-plus</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="glm-4.7">
<summary class="inference-record-summary"><span class="inference-record-title">glm-4.7</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="alibaba-requests"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>All listed tiers</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-deepseekv4pro-com" data-subscription="deepseekv4pro.com">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://deepseekv4pro.com/pricing">deepseekv4pro.com</a><span class="inference-record-subtitle"><a href="https://deepseekv4pro.com/pricing">6 recorded models / aliases</a></span></span><span class="inference-record-metric">$19.90 / $49.90; Agent $29.90 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Independent reseller; published quotas conflict. Models added by the Agent plan are marked separately.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="DeepSeek V4 Flash">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek V4 Flash</span><span class="inference-record-metric">$2.36 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="reseller-conflict"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>DeepSeek plans / Agent plan</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-flash-0731/endpoints">$2.36</a><span class="inference-fact-note">StreamLake, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="DeepSeek V4 Pro">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek V4 Pro</span><span class="inference-record-metric">$12.01 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="reseller-conflict"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>DeepSeek plans / Agent plan</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-0813/endpoints">$12.01</a><span class="inference-fact-note">DeepSeek</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GLM-5.3">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.3</span><span class="inference-record-metric">$45.95 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="reseller-conflict"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Agent plan only</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="GLM-5.2">
<summary class="inference-record-summary"><span class="inference-record-title">GLM-5.2</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="reseller-conflict"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Agent plan only</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="MiniMax M3">
<summary class="inference-record-summary"><span class="inference-record-title">MiniMax M3</span><span class="inference-record-metric">$15.50 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="reseller-conflict"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Agent plan only</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/minimax/minimax-m3/endpoints">$15.50</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Kimi K3">
<summary class="inference-record-summary"><span class="inference-record-title">Kimi K3</span><span class="inference-record-metric">$96.95 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="reseller-conflict"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Agent plan only</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/moonshotai/kimi-k3/endpoints">$96.95</a><span class="inference-fact-note">Sail Research, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-mimo-token-plan" data-subscription="MiMo Token Plan">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">MiMo Token Plan</a><span class="inference-record-subtitle"><a href="https://mimo.mi.com/docs/en-US/price/token-plan">2 recorded models / aliases</a></span></span><span class="inference-record-metric">$6 / $16 / $50 / $100 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Text models only. Credit pools are shared across models; daytime and off-peak rows are alternative allocations.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="MiMo V2.5">
<summary class="inference-record-summary"><span class="inference-record-title">MiMo V2.5</span><span class="inference-record-metric">8 scenarios</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="mimo-lite-v25-daytime"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Lite; daytime</dd></div><div><dt>Processed / 30 days (output)</dt><dd>650.12M (3.04M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.98</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>0.9% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-lite-v25-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Lite; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>812.66M (3.79M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.58</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>20.7% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-standard-v25-daytime"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Standard; daytime</dd></div><div><dt>Processed / 30 days (output)</dt><dd>1.74B (8.14M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.96</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>1.5% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-standard-v25-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Standard; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>2.18B (10.18M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.57</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>21.2% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-pro-v25-daytime"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; daytime</dd></div><div><dt>Processed / 30 days (output)</dt><dd>6.03B (28.13M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.78</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>10.9% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-pro-v25-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>7.53B (35.17M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.42</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>28.7% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-max-v25-daytime"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Max; daytime</dd></div><div><dt>Processed / 30 days (output)</dt><dd>13.00B (60.71M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.65</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>17.4% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-max-v25-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Max; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>16.25B (75.89M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$1.32</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>33.9% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="MiMo V2.5 Pro">
<summary class="inference-record-summary"><span class="inference-record-title">MiMo V2.5 Pro</span><span class="inference-record-metric">8 scenarios</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="mimo-lite-pro-daytime"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Lite; daytime</dd></div><div><dt>Processed / 30 days (output)</dt><dd>263.55M (1.23M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$4.88</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>77.0% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-lite-pro-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Lite; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>329.44M (1.54M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$3.90</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>81.6% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-standard-pro-daytime"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Standard; daytime</dd></div><div><dt>Processed / 30 days (output)</dt><dd>707.10M (3.30M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$4.85</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>77.2% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-standard-pro-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Standard; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>883.87M (4.13M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$3.88</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>81.7% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-pro-pro-daytime"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; daytime</dd></div><div><dt>Processed / 30 days (output)</dt><dd>2.44B (11.41M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$4.38</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>79.3% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-pro-pro-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>3.05B (14.26M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$3.51</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>83.5% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-max-pro-daytime"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Max; daytime</dd></div><div><dt>Processed / 30 days (output)</dt><dd>5.27B (24.61M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$4.06</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>80.8% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="mimo-max-pro-off-peak"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Max; off-peak</dd></div><div><dt>Processed / 30 days (output)</dt><dd>6.59B (30.77M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$3.25</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>84.7% less</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-chutes" data-subscription="Chutes">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://chutes.ai/pricing">Chutes</a><span class="inference-record-subtitle"><a href="https://llm.chutes.ai/v1/models">14 recorded models / aliases</a></span></span><span class="inference-record-metric">$10 / $20 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Served catalog; exact subscription tier eligibility needs account confirmation. Flash capacity remains a conditional ceiling.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="Qwen/Qwen3-32B-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen/Qwen3-32B-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen/Qwen3.5-397B-A17B-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen/Qwen3.5-397B-A17B-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="google/gemma-4-31B-turbo-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">google/gemma-4-31B-turbo-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="zai-org/GLM-5.1-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">zai-org/GLM-5.1-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="deepseek-ai/DeepSeek-V3.2-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">deepseek-ai/DeepSeek-V3.2-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen/Qwen3.6-27B-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen/Qwen3.6-27B-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="moonshotai/Kimi-K2.6-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">moonshotai/Kimi-K2.6-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen/Qwen3.8-27B-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen/Qwen3.8-27B-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="deepseek-ai/DeepSeek-V4-Flash-0731-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">deepseek-ai/DeepSeek-V4-Flash-0731-TEE</span><span class="inference-record-metric">2 scenarios</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="chutes-plus"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Plus; conditional ceiling</dd></div><div><dt>Processed / 30 days (output)</dt><dd>785.87M (3.67M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$2.73</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-flash-0731/endpoints">$2.36</a><span class="inference-fact-note">StreamLake, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>15.5% more expensive</dd></div></dl></div><div class="inference-model-scenario" data-offer="chutes-pro"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro; conditional ceiling</dd></div><div><dt>Processed / 30 days (output)</dt><dd>1.57B (7.34M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$2.73</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-flash-0731/endpoints">$2.36</a><span class="inference-fact-note">StreamLake, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>15.5% more expensive</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="zai-org/GLM-5.2-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">zai-org/GLM-5.2-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="moonshotai/Kimi-K3-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">moonshotai/Kimi-K3-TEE</span><span class="inference-record-metric">$96.95 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/moonshotai/kimi-k3/endpoints">$96.95</a><span class="inference-fact-note">Sail Research, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="unsloth/Mistral-Nemo-Instruct-2407-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">unsloth/Mistral-Nemo-Instruct-2407-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Qwen/Qwen3-235B-A22B-Thinking-2507-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">Qwen/Qwen3-235B-A22B-Thinking-2507-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="Nemotron-3-Nano-Omni-30B-TEE">
<summary class="inference-record-summary"><span class="inference-record-title">Nemotron-3-Nano-Omni-30B-TEE</span><span class="inference-record-metric">Pricing not established</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd>Not quoted</dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div></div>
</details>
<details class="inference-subscription-record" id="inference-plan-nanogpt" data-subscription="NanoGPT">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://nano-gpt.com/blog/how-to-save-money-on-ai">NanoGPT</a><span class="inference-record-subtitle"><a href="https://nano-gpt.com/api/subscription/v1/models?detailed=true">296 recorded models / aliases</a></span></span><span class="inference-record-metric">$12 advertised / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Subscription-included model/variant catalog. Per-model multipliers were not captured, so the 1x/2x quota examples cannot be assigned to individual IDs.</p><div class="inference-unassigned"><p class="inference-plan-label">Unassigned quota examples</p><ul><li><strong>Included model at 1x input weight</strong><span>$9.95 / 1M output + input</span></li><li><strong>Included model at 2x input weight</strong><span>$19.90 / 1M output + input</span></li></ul><p>Per-model weights remain unknown.</p></div><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="z-ai/glm-5.3-flash">
<summary class="inference-record-summary"><span class="inference-record-title">GLM 5.3 Flash</span><span class="inference-record-metric">$3.90 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="minimax/minimax-m3">
<summary class="inference-record-summary"><span class="inference-record-title">MiniMax M3</span><span class="inference-record-metric">$15.50 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/minimax/minimax-m3/endpoints">$15.50</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="xiaomi/mimo-v2.5">
<summary class="inference-record-summary"><span class="inference-record-title">MiMo V2.5</span><span class="inference-record-metric">$1.99 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="xiaomi/mimo-v2.5-pro">
<summary class="inference-record-summary"><span class="inference-record-title">MiMo V2.5 Pro</span><span class="inference-record-metric">$21.21 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="z-ai/glm-5.3">
<summary class="inference-record-summary"><span class="inference-record-title">GLM 5.3</span><span class="inference-record-metric">$45.95 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="deepseek/deepseek-v4-flash-0731">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek V4 Flash 0731</span><span class="inference-record-metric">$2.36 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-flash-0731/endpoints">$2.36</a><span class="inference-fact-note">StreamLake, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="deepseek/deepseek-v4-pro-0813">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek V4 Pro 0813</span><span class="inference-record-metric">$12.01 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-0813/endpoints">$12.01</a><span class="inference-fact-note">DeepSeek</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div><details class="inference-catalog-disclosure"><summary>Show 289 additional NanoGPT catalog models / variants</summary><p>These IDs have no matched allowance or OpenRouter quote in this snapshot. Catalog coverage: Subscription-included endpoint.</p><ul class="inference-catalog-list"><li>Muse Spark 1.3 Contributor</li><li>Mercury 2.5 Preview</li><li>Granite 4.2 8B</li><li>TheDrummer/Artemis v1.1</li><li>DeepSeek V4 Flash Vision Exp Uncensored</li><li>GLM 5.3 Flash Uncensored</li><li>Gemma 4 26B A4B Uncensored</li><li>Gemma 4 26B A4B Uncensored Thinking</li><li>Qwen 3.8 27B Uncensored</li><li>Qwen 3.8 27B Fable</li><li>Qwen 3.8 27B Uncensored Thinking</li><li>Qwen 3.8 27B Obliterated</li><li>Qwen 3.8 27B Obliterated Thinking</li><li>Qwen 3.6 35B A3B Uncensored</li><li>Qwen 3.6 35B A3B Uncensored Thinking</li><li>Ornith 1.5 9B</li><li>Ornith 1.5 9B Thinking</li><li>Gemma 4 31B MeroMero v2</li><li>Gemma 4 31B MeroMero v2 Thinking</li><li>Gemma 4 26B A4B MeroMero</li><li>Gemma 4 26B A4B MeroMero Thinking</li><li>Gemma 4 26B A4B Musica</li><li>Gemma 4 26B A4B Shadow Siren</li><li>Gemma 4 26B A4B Chimera X</li><li>Gemma 4 26B A4B Luminous Mirror</li><li>Gemma 4 26B A4B Dark Soul</li><li>Gemma 4 26B A4B Moonlight Dusk</li><li>Gemma 4 26B A4B Opus Distill</li><li>Gemma 4 31B Fabled</li><li>Gemma 4 31B DarkIdol</li><li>Gemma 4 31B Garnet</li><li>Gemma 4 31B Novelist</li><li>Gemma 4 31B Isometry</li><li>Gemma 4 31B Gembrain</li><li>Gemma 4 31B Gemsicle</li><li>Ornith 1.5 35B</li><li>Ornith 1.5 35B Thinking</li><li>Qwen3.8 27B</li><li>Qwen3.8 27B Thinking</li><li>Gemma 4 12B Instruct</li><li>Gemma 4 E4B Instruct</li><li>Gemma 4 E2B Instruct</li><li>Laguna S 2.1</li><li>Laguna S 2.1 Thinking</li><li>Nvidia Nemotron 3.5 Lightning</li><li>Nvidia Nemotron 3.5 Lightning Thinking</li><li>Nvidia Nemotron 3 Ultra 550B</li><li>Nvidia Nemotron 3 Ultra 550B Thinking</li><li>LFM2.5 2.6B</li><li>Muse Glimmer 30B</li><li>Muse Spark 1.2 Contributor</li><li>LongCat 2.0</li><li>LongCat 2.0 Thinking</li><li>Step 3.7 Flash Thinking</li><li>Doubao Seed Character</li><li>NanoGPT Help</li><li>Auto model</li><li>Auto model (Basic)</li><li>Auto model (Standard)</li><li>Auto model (Premium)</li><li>Claw High</li><li>Claw Medium</li><li>Claw Low</li><li>Hermes High</li><li>Hermes Medium</li><li>Hermes Low</li><li>GPT OSS 120B</li><li>GPT OSS 20B</li><li>Amoral Gemma3 27B v2</li><li>Mistral Devstral Small 2505</li><li>Veiled Calla 12B</li><li>Qwen: QvQ Max</li><li>Step 3.5 Flash 2603</li><li>Step 3.5 Flash</li><li>Nex N2 Mini</li><li>Qwen 3 Coder 480B</li><li>Llama 4 Maverick</li><li>Llama 4 Scout</li><li>DeepSeek R1 0528</li><li>Kimi K2 Thinking</li><li>Kimi K2.5</li><li>Kimi K2.5 Thinking</li><li>Kimi K2.6</li><li>Kimi K2.7 Code</li><li>Kimi K2.6 Thinking</li><li>Ministral 3 14B</li><li>Mistral Small 4 119B</li><li>Mistral Small 4 119B Thinking</li><li>Mistral Large 3 675B</li><li>Devstral 2 123B</li><li>Hermes 4 Large (Thinking)</li><li>OpenReasoning Nemotron 32B</li><li>DeepSeek R1</li><li>DeepSeek V3/Deepseek Chat</li><li>MiniMax 01</li><li>MiniMax M2.5</li><li>Qwen 3 235b A22B</li><li>Qwen3.5 9B</li><li>Qwen 3 32b</li><li>Qwen 3 14b</li><li>Qwen3 30B A3B</li><li>Qwen3 Coder 30B A3B Instruct</li><li>Qwen 3 235b A22B 2507</li><li>Qwen 3 235b A22B 2507 Thinking</li><li>Qwen3 Next 80B A3B (Instruct)</li><li>Qwen3 Next 80B A3B (Thinking)</li><li>MiniMax M2</li><li>MiniMax M3 Thinking</li><li>MiniMax M2.7</li><li>MiniMax Latest</li><li>MiMo V2.5 Thinking</li><li>MiMo V2.5 Pro Thinking</li><li>MiniMax M2.1</li><li>GLM 4.6</li><li>GLM 4.6 Thinking</li><li>GLM 5</li><li>GLM 5 Thinking</li><li>GLM 5.1</li><li>GLM Latest</li><li>GLM 5.1 Thinking</li><li>GLM 5.2</li><li>GLM 5.2 Thinking</li><li>GLM 5.3 Thinking</li><li>GLM 4.7 Flash Original</li><li>GLM 4.7 Flash Original Thinking</li><li>GLM 4.7 Flash</li><li>GLM 4.7 Flash Thinking</li><li>GLM 4.7</li><li>GLM 4.7 Thinking</li><li>GLM 4.6V</li><li>Qwen3 30B A3B Instruct 2507</li><li>Llama 3.3 70b Instruct</li><li>Nvidia Nemotron 70b</li><li>Sao10K Stheno 8b</li><li>Grayline Qwen3 8B</li><li>Hermes 4 Large</li><li>Hermes 3 70B</li><li>Qwen3.8 Flash</li><li>Qwen3.5 122B A10B</li><li>Qwen3.5 122B A10B Thinking</li><li>Qwen3.5 27B</li><li>Qwen3.5 27B Thinking</li><li>Qwen3.5 35B A3B</li><li>Qwen3.5 35B A3B Thinking</li><li>Qwen3.6 35B A3B</li><li>Qwen3.6 35B A3B Thinking</li><li>Qwen3.6 27B</li><li>Qwen3.6 27B Thinking</li><li>DeepSeek V3.2 Exp</li><li>DeepSeek V3.2 Exp Thinking</li><li>DeepSeek V3.2</li><li>DeepSeek V3.2 Thinking</li><li>DeepSeek V4 Flash</li><li>DeepSeek V4 Flash Vision Exp</li><li>DeepSeek V4 Flash Latest</li><li>DeepSeek V4 Flash 0731 (Thinking)</li><li>DeepSeek V4 Flash (Thinking)</li><li>DeepSeek V4 Pro 0813 Thinking</li><li>DeepSeek V4 Pro</li><li>DeepSeek Latest</li><li>DeepSeek V4 Pro (Thinking)</li><li>Qwen3.5 397B A17B</li><li>Qwen3.5 397B A17B Thinking</li><li>Qwen 2.5 Coder 32b</li><li>Phi 4 Multimodal</li><li>Phi 4 Mini</li><li>The Drummer Cydonia 24B v2</li><li>The Drummer Cydonia 24B v4</li><li>The Drummer Cydonia 24B v4.1</li><li>The Drummer Cydonia 24B v4.3</li><li>The Drummer Magidonia 24B v4.3</li><li>MS3.2 24B Magnum Diamond</li><li>Omega Directive 24B Unslop v2.0</li><li>EVA Llama 3.33 70B</li><li>Steelskull Nevoria 70b</li><li>Steelskull Nevoria R1 70b</li><li>Steelskull Electra R1 70b</li><li>Qwen2 72B Dracarys</li><li>Lumimaid v0.2</li><li>DeepSeek V3/Chat Cheaper</li><li>Llama 3.3 70B Instruct abliterated</li><li>MythoMax 13B</li><li>Qwen2.5 72B</li><li>EVA-Qwen2.5-32B-v0.2</li><li>TheDrummer Skyfall 36B V2</li><li>Qwen 3 8B</li><li>K2-Think</li><li>DeepSeek V3.1</li><li>DeepSeek V3.1 Thinking</li><li>DeepSeek V3.1 Terminus</li><li>DeepSeek V3.1 Terminus (Thinking)</li><li>DeepSeek Chat 0324</li><li>GLM 4.5 (Thinking)</li><li>GLM 4.5</li><li>GLM 4.5 Air</li><li>GLM 4.5 Air (Thinking)</li><li>MN-LooseCannon-12B-v1</li><li>EVA-Qwen2.5-72B-v0.2</li><li>EVA-LLaMA-3.33-70B-v0.1</li><li>Llama 3.1 8b Instruct</li><li>ReMM SLERP 13B</li><li>Mistral Saba</li><li>Neural Daredevil 8B abliterated</li><li>Llama 3 70B abliterated</li><li>Magnum V2 72B</li><li>Mistral Nemo</li><li>DeepSeek Reasoner</li><li>Llama 3.05 Storybreaker Ministral 70b</li><li>Nemotron Tenyxchat Storybreaker 70b</li><li>Mag Mell R1</li><li>Qwerky 72B</li><li>Anubis 70B v1</li><li>Anubis 70B v1.1</li><li>Llama 3.2 3b Instruct</li><li>Llama 3.1 8B (decentralized)</li><li>Llama 3.1 70B Hanami</li><li>Rocinante 12b</li><li>Llama 3.3 70B Euryale</li><li>Llama 3.1 70B Euryale</li><li>Llama 3.3 70B Cu Mai</li><li>UnslopNemo 12b v4</li><li>NemoMix 12B Unleashed</li><li>Mistral Nemo Starcannon 12b v1</li><li>Llama 3.1 70B Celeste v0.1</li><li>DeepSeek R1 Qwen Abliterated</li><li>DeepSeek R1 Llama 70B Abliterated</li><li>Qwen 2.5 32B Abliterated</li><li>Deepseek R1 Cheaper</li><li>Llama 3.3 70B Wayfarer</li><li>Gemma 3 27B IT</li><li>Gemma 3 12B IT</li><li>Gemma 3 4B IT</li><li>Qwen25 VL 72b</li><li>Holo3-35B-A3B</li><li>Holo3-35B-A3B Thinking</li><li>Cogito v1 Preview Qwen 32B</li><li>Llama-xLAM-2 70B fc-r</li><li>Mistral Small 31 24b Instruct</li><li>Mistral Small 3.2 24b Instruct</li><li>Nvidia Nemotron Super 49B</li><li>Shisa V2 Llama 3.3 70B</li><li>Shisa V2.1 Llama 3.3 70B</li><li>GLM 4 9B 0414</li><li>GLM 4 32B 0414</li><li>Qwen3.5 27B Blossom V6.4 Derestricted</li><li>Qwen3.5 27B Claude 4.6 Opus Reasoning Distilled Derestricted</li><li>Qwen3.5 27B Claude 4.6 Opus Reasoning Distilled Derestricted Lite</li><li>Gemma 4 31B Agares v1</li><li>Gemma 4 31B Animus V14.1</li><li>Gemma 4 31B AssGuard</li><li>Gemma 4 31B Dark Gemistry</li><li>Gemma 4 31B Gembrain Uncensored Heretic</li><li>Gemma 4 31B Gembrain X Core</li><li>Gemma 4 31B Isometry RP</li><li>Gemma 4 31B Mero Artemis v0.3.1</li><li>Gemma 4 31B Novelist (ArliAI)</li><li>Gemma 4 31B SDFT Heretic RP</li><li>Gemma 4 31B StyleTune</li><li>Qwen3.5 27B BlueStar v3 Derestricted</li><li>Qwen3.5 27B Queen Derestricted</li><li>Gemma 4 31B Claude 4.6 Opus Reasoning Distilled</li><li>Gemma 4 31B Cognitive Unshackled</li><li>Gemma 4 31B DarkIdol (ArliAI)</li><li>Gemma 4 31B Fabled (ArliAI)</li><li>Gemma 4 31B Garnet V2</li><li>Gemma 4 31B K1 v5</li><li>Gemma 4 31B MeroMero</li><li>Gemma 4 31B Queen</li><li>GLM 4.6 Derestricted v5</li><li>Venice Uncensored</li><li>Gemma 4 26B A4B</li><li>Gemma 4 26B A4B Thinking</li><li>Tencent Hy3</li><li>Qwen3 Coder Next</li><li>Ling 3.0 Flash</li><li>Ling 3.0 Flash Thinking</li><li>Gemma 4 31B</li><li>Gemma 4 31B Thinking</li><li>Nvidia Nemotron 3 Nano 30B</li><li>Nvidia Nemotron 3 Nano Omni</li><li>Nvidia Nemotron 3 Super 120B</li><li>Nvidia Nemotron 3 Super 120B Thinking</li><li>Nex N2 Pro</li><li>Manta Mini 1.0</li><li>MiMo V2.5 Pro (Crof)</li><li>MiMo V2.5 Pro Thinking (Crof)</li><li>Mistral Code Agent Latest</li><li>Synth 2.5 Flash Preview</li><li>Synth 2.5 Pro Preview</li></ul></details></div>
</details>
<details class="inference-subscription-record" id="inference-plan-kilo-pass" data-subscription="Kilo Pass">
<summary class="inference-record-summary"><span class="inference-record-title"><a href="https://kilo.ai/pricing/kilo-pass">Kilo Pass</a><span class="inference-record-subtitle"><a href="https://api.kilo.ai/api/gateway/models">371 recorded models / aliases</a></span></span><span class="inference-record-metric">$19 / $49 / $199 / month</span></summary>
<div class="inference-record-details"><p class="inference-subscription-note">Gateway catalog includes free and paid variants. Annual credit bonus is modeled only where provider rates were captured; catalog presence alone does not establish eligibility.</p><div class="inference-model-record-list"><details class="inference-record inference-model-record" data-model="anthropic/claude-sonnet-5">
<summary class="inference-record-summary"><span class="inference-record-title">Anthropic: Claude Sonnet 5</span><span class="inference-record-metric">3 scenarios</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="kilo-starter-sonnet"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Starter annual billing</dd></div><div><dt>Processed / 30 days (output)</dt><dd>91.59M (0.43M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$44.43</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/anthropic/claude-sonnet-5/endpoints">$70.31</a><span class="inference-fact-note">Anthropic</span></dd></div><div><dt>Subscription saving</dt><dd>36.8% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="kilo-pro-sonnet"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro annual billing</dd></div><div><dt>Processed / 30 days (output)</dt><dd>236.21M (1.10M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$44.43</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/anthropic/claude-sonnet-5/endpoints">$70.31</a><span class="inference-fact-note">Anthropic</span></dd></div><div><dt>Subscription saving</dt><dd>36.8% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="kilo-expert-sonnet"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Expert annual billing</dd></div><div><dt>Processed / 30 days (output)</dt><dd>959.32M (4.48M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$44.43</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/anthropic/claude-sonnet-5/endpoints">$70.31</a><span class="inference-fact-note">Anthropic</span></dd></div><div><dt>Subscription saving</dt><dd>36.8% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="z-ai/glm-5.3">
<summary class="inference-record-summary"><span class="inference-record-title">Z.ai: GLM 5.3</span><span class="inference-record-metric">$45.95 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3/endpoints">$45.95</a><span class="inference-fact-note">BaseTen, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="moonshotai/kimi-k3">
<summary class="inference-record-summary"><span class="inference-record-title">MoonshotAI: Kimi K3</span><span class="inference-record-metric">$96.95 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/moonshotai/kimi-k3/endpoints">$96.95</a><span class="inference-fact-note">Sail Research, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="minimax/minimax-m3">
<summary class="inference-record-summary"><span class="inference-record-title">MiniMax: MiniMax M3</span><span class="inference-record-metric">3 scenarios</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario" data-offer="kilo-starter-m3"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Starter annual billing</dd></div><div><dt>Processed / 30 days (output)</dt><dd>387.20M (1.81M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$10.51</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/minimax/minimax-m3/endpoints">$15.50</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>32.2% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="kilo-pro-m3"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Pro annual billing</dd></div><div><dt>Processed / 30 days (output)</dt><dd>998.57M (4.66M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$10.51</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/minimax/minimax-m3/endpoints">$15.50</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>32.2% less</dd></div></dl></div><div class="inference-model-scenario" data-offer="kilo-expert-m3"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>Expert annual billing</dd></div><div><dt>Processed / 30 days (output)</dt><dd>4.06B (18.94M output)</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd><strong>$10.51</strong></dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/minimax/minimax-m3/endpoints">$15.50</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>32.2% less</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="z-ai/glm-5.3-flash">
<summary class="inference-record-summary"><span class="inference-record-title">Z.ai: GLM 5.3 Flash</span><span class="inference-record-metric">$3.90 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/z-ai/glm-5.3-flash/endpoints">$3.90</a><span class="inference-fact-note">Relace, FP4</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="deepseek/deepseek-v4-pro-0813">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek: DeepSeek V4 Pro 0813</span><span class="inference-record-metric">$12.01 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-pro-0813/endpoints">$12.01</a><span class="inference-fact-note">DeepSeek</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="deepseek/deepseek-v4-flash-0731">
<summary class="inference-record-summary"><span class="inference-record-title">DeepSeek: DeepSeek V4 Flash 0731</span><span class="inference-record-metric">$2.36 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/deepseek/deepseek-v4-flash-0731/endpoints">$2.36</a><span class="inference-fact-note">StreamLake, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="xiaomi/mimo-v2.5-pro">
<summary class="inference-record-summary"><span class="inference-record-title">Xiaomi: MiMo-V2.5-Pro</span><span class="inference-record-metric">$21.21 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5-pro/endpoints">$21.21</a><span class="inference-fact-note">DeepInfra, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details>
<details class="inference-record inference-model-record" data-model="xiaomi/mimo-v2.5">
<summary class="inference-record-summary"><span class="inference-record-title">Xiaomi: MiMo-V2.5</span><span class="inference-record-metric">$1.99 OpenRouter</span></summary>
<div class="inference-record-details"><div class="inference-model-scenario"><dl class="inference-facts"><div><dt>Tier / conditions</dt><dd>See plan terms</dd></div><div><dt>Processed / 30 days (output)</dt><dd>Not established</dd></div><div><dt>Subscription $ / 1M output + input</dt><dd>Not established</dd></div><div><dt>OpenRouter $ / 1M output + input</dt><dd><a href="https://openrouter.ai/api/v1/models/xiaomi/mimo-v2.5/endpoints">$1.99</a><span class="inference-fact-note">Xiaomi, FP8</span></dd></div><div><dt>Subscription saving</dt><dd>Not established</dd></div></dl></div></div>
</details></div><details class="inference-catalog-disclosure"><summary>Show 362 additional Kilo Pass catalog models / variants</summary><p>These IDs have no matched allowance or OpenRouter quote in this snapshot. Catalog coverage: Served catalog; consult plan terms for eligibility.</p><ul class="inference-catalog-list"><li>Auto Frontier</li><li>Auto Balanced</li><li>Auto Efficient</li><li>Auto Free</li><li>StepFun: Step 3.7 Flash (free)</li><li>Poolside: Laguna S 2.1 (free)</li><li>MiniMax: MiniMax M3 (free)</li><li>MiniMax: MiniMax M2.7 (free)</li><li>Dots Studio: Dots3-Note Preview (free)</li><li>Claude Opus 5</li><li>OpenAI: GPT-5.6 Sol</li><li>OpenAI: GPT-5.6 Sol (50% off)</li><li>OpenAI: GPT-6 Astra ($$$$)</li><li>OpenAI: GPT-6 Astra Pro ($$$$)</li><li>inclusionAI: Ling 3.0 Flash Sante (free)</li><li>Qwen: Qwen3.8 Max (0902)</li><li>Meta: Muse Spark 1.3 Contributor</li><li>Meta: Muse Spark 1.3</li><li>Google: Gemini 3.8 Flash</li><li>Anthropic: Claude Fable 5.1 ($$$$)</li><li>Inception: Mercury 2.5 Preview</li><li>IBM: Granite 4.2 8B</li><li>Tencent: Hy4 preview</li><li>inclusionAI: Ling 3.0 Flash Fin</li><li>inclusionAI: Ling 3.0 Flash Fin (free)</li><li>Z.ai: GLM Flash Latest</li><li>Qwen: Qwen3.8 Flash</li><li>Meta: Muse Spark 1.2 Contributor</li><li>DeepSeek: DeepSeek V4 Flash Vision Exp</li><li>Tencent: Hy-MT2-1.8B</li><li>Tencent: Hy-MT2-30B-A3B</li><li>Z.ai: GLM Latest</li><li>Tencent: Hy-MT2-7B</li><li>Qwen: Qwen3.8 27B</li><li>Google: Gemini 3.7 Flash</li><li>ByteDance Seed: Seed 2.1 Turbo</li><li>Qwen: Qwen3.8 2.4T A95B</li><li>ByteDance Seed: Seed-2.0-Code</li><li>SpaceXAI: Grok 4.6</li><li>LiquidAI: LFM2.5-2.6B (free)</li><li>NVIDIA: Nemotron 3.5 Lightning</li><li>NVIDIA: Nemotron 3.5 Lightning (free)</li><li>Sakana: Sakana Namazu</li><li>Upstage: Solar Pro 4</li><li>Meta: Muse Glimmer 30B</li><li>Meta: Muse Spark 1.2</li><li>DeepSeek V4 Flash Latest</li><li>Thinking Machines: Inkling Small</li><li>Thinking Machines: Inkling Small (free)</li><li>Qwen: Qwen3.7 Flash</li><li>inclusionAI: Ling 3.0 Flash</li><li>Poolside: Laguna S 2.1</li><li>Google: Gemini 3.6 Flash</li><li>Google: Gemini 3.5 Flash Lite</li><li>Meituan: LongCat 2.0</li><li>Thinking Machines: Inkling</li><li>Thinking Machines: Inkling (free)</li><li>OpenRouter Auto Router (Beta)</li><li>Meta: Muse Spark 1.1</li><li>Kwaipilot: KAT-Coder-Pro V2.5</li><li>OpenAI: GPT-5.6 Luna Pro</li><li>OpenAI: GPT-5.6 Luna</li><li>OpenAI: GPT-5.6 Terra Pro</li><li>OpenAI: GPT-5.6 Terra</li><li>OpenAI: GPT-5.6 Sol Pro</li><li>SpaceXAI: Grok 4.5</li><li>xAI: Grok Latest</li><li>AionLabs: Aion-3.0-Mini</li><li>AionLabs: Aion-3.0</li><li>Tencent: Hy3</li><li>Poolside: Laguna XS 2.1</li><li>Poolside: Laguna XS 2.1 (free)</li><li>Google: Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)</li><li>Nex AGI: Nex-N2-Mini (retires Sep 8)</li><li>Sakana: Fugu Ultra</li><li>Google: Nano Banana 2 (Gemini 3.1 Flash Image)</li><li>Google: Nano Banana Pro (Gemini 3 Pro Image)</li><li>Cohere: North Mini Code (free)</li><li>Z.ai: GLM 5.2</li><li>OpenRouter: Fusion</li><li>MoonshotAI: Kimi K2.7 Code</li><li>Anthropic: Claude Fable Latest ($$$$)</li><li>Anthropic: Claude Fable 5 ($$$$)</li><li>Nex AGI: Nex-N2-Pro (retires Sep 8)</li><li>NVIDIA: Nemotron 3.5 Content Safety</li><li>NVIDIA: Nemotron 3.5 Content Safety (free)</li><li>NVIDIA: Nemotron 3 Ultra</li><li>NVIDIA: Nemotron 3 Ultra (free)</li><li>Qwen: Qwen3.7 Plus (20% off)</li><li>StepFun: Step 3.7 Flash</li><li>Anthropic: Claude Opus 4.8</li><li>Qwen: Qwen3.7 Max (50% off)</li><li>SpaceXAI: Grok Build 0.1</li><li>Google: Gemini 3.5 Flash</li><li>Perceptron: Perceptron Mk1</li><li>Google: Gemini 3.1 Flash Lite</li><li>OpenAI: GPT Chat Latest</li><li>SpaceXAI: Grok 4.3</li><li>Mistral: Mistral Medium 3.5</li><li>NVIDIA: Nemotron 3 Nano Omni (free)</li><li>Anthropic Claude Haiku Latest</li><li>OpenAI GPT Mini Latest</li><li>Google Gemini Pro Latest</li><li>MoonshotAI Kimi Latest</li><li>Google Gemini Flash Latest</li><li>Anthropic Claude Sonnet Latest</li><li>OpenAI GPT Latest</li><li>Qwen: Qwen3.5 Plus 2026-04-20</li><li>Qwen: Qwen3.6 Flash</li><li>Qwen: Qwen3.6 35B A3B</li><li>Qwen: Qwen3.6 Max Preview</li><li>Qwen: Qwen3.6 27B</li><li>OpenAI: GPT-5.5 Pro ($$$$)</li><li>OpenAI: GPT-5.5</li><li>DeepSeek: DeepSeek V4 Pro 0423</li><li>DeepSeek: DeepSeek V4 Flash 0423</li><li>Tencent: Hy3 preview</li><li>OpenAI: GPT-5.4 Image 2</li><li>Anthropic: Claude Opus Latest</li><li>OpenRouter Pareto Code Router</li><li>MoonshotAI: Kimi K2.6</li><li>Anthropic: Claude Opus 4.7</li><li>Z.ai: GLM 5.1</li><li>Google: Gemma 4 26B A4B </li><li>Google: Gemma 4 31B</li><li>Qwen: Qwen3.6 Plus</li><li>Z.ai: GLM 5V Turbo</li><li>Arcee AI: Trinity Large Thinking</li><li>SpaceXAI: Grok 4.20 Multi-Agent</li><li>SpaceXAI: Grok 4.20</li><li>Google: Lyria 3 Pro Preview</li><li>Google: Lyria 3 Clip Preview</li><li>Kwaipilot: KAT-Coder-Pro V2</li><li>Reka Edge</li><li>MiniMax: MiniMax M2.7</li><li>OpenAI: GPT-5.4 Nano</li><li>OpenAI: GPT-5.4 Mini</li><li>Mistral: Mistral Small 4</li><li>Z.ai: GLM 5 Turbo</li><li>NVIDIA: Nemotron 3 Super</li><li>NVIDIA: Nemotron 3 Super (free)</li><li>ByteDance Seed: Seed-2.0-Lite</li><li>Qwen: Qwen3.5-9B</li><li>OpenAI: GPT-5.4 Pro ($$$$)</li><li>OpenAI: GPT-5.4</li><li>Inception: Mercury 2</li><li>Google: Gemini 3.1 Flash Lite Preview</li><li>ByteDance Seed: Seed-2.0-Mini</li><li>Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)</li><li>Qwen: Qwen3.5-35B-A3B</li><li>Qwen: Qwen3.5-27B</li><li>Qwen: Qwen3.5-122B-A10B</li><li>Qwen: Qwen3.5-Flash</li><li>Google: Gemini 3.1 Pro Preview Custom Tools</li><li>OpenAI: GPT-5.3-Codex</li><li>AionLabs: Aion-2.0</li><li>Google: Gemini 3.1 Pro Preview</li><li>Anthropic: Claude Sonnet 4.6</li><li>Qwen: Qwen3.5 Plus 2026-02-15</li><li>Qwen: Qwen3.5 397B A17B</li><li>MiniMax: MiniMax M2.5</li><li>Z.ai: GLM 5</li><li>Qwen: Qwen3 Max Thinking</li><li>Anthropic: Claude Opus 4.6</li><li>Qwen: Qwen3 Coder Next</li><li>OpenRouter Free Models Router</li><li>StepFun: Step 3.5 Flash</li><li>MoonshotAI: Kimi K2.5</li><li>Upstage: Solar Pro 3</li><li>MiniMax: MiniMax M2-her</li><li>Writer: Palmyra X5</li><li>OpenAI: GPT Audio</li><li>OpenAI: GPT Audio Mini</li><li>Z.ai: GLM 4.7 Flash (retires Sep 10)</li><li>OpenAI: GPT-5.2-Codex</li><li>ByteDance Seed: Seed 1.6 Flash</li><li>ByteDance Seed: Seed 1.6</li><li>MiniMax: MiniMax M2.1</li><li>Z.ai: GLM 4.7</li><li>Google: Gemini 3 Flash Preview</li><li>NVIDIA: Nemotron 3 Nano 30B A3B</li><li>OpenAI: GPT-5.2 Chat</li><li>OpenAI: GPT-5.2 Pro ($$$$)</li><li>OpenAI: GPT-5.2</li><li>Mistral: Devstral 2 2512</li><li>Relace: Relace Search</li><li>Z.ai: GLM 4.6V</li><li>OpenRouter Body Builder (beta)</li><li>OpenAI: GPT-5.1-Codex-Max</li><li>Amazon: Nova 2 Lite</li><li>Mistral: Ministral 3 14B 2512</li><li>Mistral: Ministral 3 8B 2512</li><li>Mistral: Ministral 3 3B 2512</li><li>Mistral: Mistral Large 3 2512</li><li>DeepSeek: DeepSeek V3.2</li><li>Anthropic: Claude Opus 4.5</li><li>Google: Nano Banana Pro (Gemini 3 Pro Image Preview)</li><li>OpenAI: GPT-5.1</li><li>OpenAI: GPT-5.1-Codex</li><li>OpenAI: GPT-5.1-Codex-Mini</li><li>MoonshotAI: Kimi K2 Thinking</li><li>Amazon: Nova Premier 1.0</li><li>Perplexity: Sonar Pro Search</li><li>Mistral: Voxtral Small 24B 2507</li><li>OpenAI: gpt-oss-safeguard-20b</li><li>MiniMax: MiniMax M2</li><li>Qwen: Qwen3 VL 32B Instruct</li><li>IBM: Granite 4.0 Micro</li><li>OpenAI: GPT-5 Image Mini</li><li>Anthropic: Claude Haiku 4.5</li><li>Qwen: Qwen3 VL 8B Thinking</li><li>Qwen: Qwen3 VL 8B Instruct</li><li>OpenAI: GPT-5 Image ($$$$)</li><li>Google: Nano Banana (Gemini 2.5 Flash Image)</li><li>Qwen: Qwen3 VL 30B A3B Thinking</li><li>Qwen: Qwen3 VL 30B A3B Instruct</li><li>OpenAI: GPT-5 Pro ($$$$)</li><li>Z.ai: GLM 4.6</li><li>Anthropic: Claude Sonnet 4.5</li><li>DeepSeek: DeepSeek V3.2 Exp</li><li>TheDrummer: Cydonia 24B V4.1</li><li>Relace: Relace Apply 3</li><li>Qwen: Qwen3 VL 235B A22B Thinking</li><li>Qwen: Qwen3 VL 235B A22B Instruct</li><li>Qwen: Qwen3 Max</li><li>Qwen: Qwen3 Coder Plus</li><li>DeepSeek: DeepSeek V3.1 Terminus</li><li>Qwen: Qwen3 Coder Flash</li><li>Qwen: Qwen3 Next 80B A3B Thinking</li><li>Qwen: Qwen3 Next 80B A3B Instruct</li><li>Qwen: Qwen Plus 0728</li><li>MoonshotAI: Kimi K2 0905</li><li>Qwen: Qwen3 30B A3B Thinking 2507</li><li>Nous: Hermes 4 70B</li><li>Nous: Hermes 4 405B</li><li>DeepSeek: DeepSeek V3.1</li><li>Mistral: Mistral Medium 3.1</li><li>Z.ai: GLM 4.5V</li><li>OpenAI: GPT-5</li><li>OpenAI: GPT-5 Mini</li><li>OpenAI: GPT-5 Nano</li><li>OpenAI: gpt-oss-120b</li><li>OpenAI: gpt-oss-20b</li><li>Anthropic: Claude Opus 4.1 ($$$$)</li><li>Mistral: Codestral 2508</li><li>Qwen: Qwen3 Coder 30B A3B Instruct</li><li>Qwen: Qwen3 30B A3B Instruct 2507</li><li>Z.ai: GLM 4.5</li><li>Z.ai: GLM 4.5 Air</li><li>Qwen: Qwen3 235B A22B Thinking 2507</li><li>Qwen: Qwen3 Coder 480B A35B</li><li>ByteDance: UI-TARS 7B </li><li>Google: Gemini 2.5 Flash Lite</li><li>Qwen: Qwen3 235B A22B Instruct 2507</li><li>MoonshotAI: Kimi K2 0711</li><li>Venice: Uncensored</li><li>Tencent: Hunyuan A13B Instruct</li><li>Morph: Morph V3 Large</li><li>Morph: Morph V3 Fast</li><li>Baidu: ERNIE 4.5 VL 424B A47B </li><li>Mistral: Mistral Small 3.2 24B</li><li>MiniMax: MiniMax M1</li><li>Google: Gemini 2.5 Flash</li><li>Google: Gemini 2.5 Pro</li><li>OpenAI: o3 Pro ($$$$)</li><li>Google: Gemini 2.5 Pro Preview 06-05</li><li>DeepSeek: R1 0528</li><li>Anthropic: Claude Opus 4 ($$$$)</li><li>Anthropic: Claude Sonnet 4</li><li>Mistral: Mistral Medium 3</li><li>Google: Gemini 2.5 Pro Preview 05-06</li><li>Meta: Llama Guard 4 12B</li><li>Qwen: Qwen3 30B A3B</li><li>Qwen: Qwen3 8B</li><li>Qwen: Qwen3 14B</li><li>Qwen: Qwen3 32B</li><li>Qwen: Qwen3 235B A22B</li><li>OpenAI: o4 Mini High</li><li>OpenAI: o3</li><li>OpenAI: o4 Mini</li><li>OpenAI: GPT-4.1</li><li>OpenAI: GPT-4.1 Mini</li><li>OpenAI: GPT-4.1 Nano</li><li>Meta: Llama 4 Maverick</li><li>Meta: Llama 4 Scout</li><li>DeepSeek: DeepSeek V3 0324</li><li>OpenAI: o1-pro ($$$$)</li><li>Mistral: Mistral Small 3.1 24B</li><li>Google: Gemma 3 4B</li><li>Google: Gemma 3 12B</li><li>Cohere: Command A</li><li>Reka Flash 3</li><li>Google: Gemma 3 27B</li><li>TheDrummer: Skyfall 36B V2</li><li>Perplexity: Sonar Reasoning Pro</li><li>Perplexity: Sonar Pro</li><li>Perplexity: Sonar Deep Research</li><li>Mistral: Saba</li><li>OpenAI: o3 Mini High</li><li>AionLabs: Aion-RP 1.0 (8B)</li><li>Qwen: Qwen2.5 VL 72B Instruct</li><li>Qwen: Qwen-Plus</li><li>OpenAI: o3 Mini</li><li>Mistral: Mistral Small 3</li><li>Perplexity: Sonar</li><li>DeepSeek: R1 Distill Llama 70B</li><li>DeepSeek: R1</li><li>MiniMax: MiniMax-01</li><li>Microsoft: Phi 4</li><li>DeepSeek: DeepSeek V3</li><li>Sao10K: Llama 3.3 Euryale 70B</li><li>OpenAI: o1 ($$$$)</li><li>Cohere: Command R7B (12-2024)</li><li>Meta: Llama 3.3 70B Instruct</li><li>Amazon: Nova Lite 1.0</li><li>Amazon: Nova Micro 1.0</li><li>Amazon: Nova Pro 1.0</li><li>OpenAI: GPT-4o (2024-11-20)</li><li>Mistral Large 2407</li><li>Qwen2.5 Coder 32B Instruct</li><li>TheDrummer: UnslopNemo 12B</li><li>Magnum v4 72B</li><li>Qwen: Qwen2.5 7B Instruct</li><li>Meta: Llama 3.2 1B Instruct</li><li>Meta: Llama 3.2 3B Instruct</li><li>Qwen2.5 72B Instruct</li><li>Cohere: Command R (08-2024)</li><li>Cohere: Command R+ (08-2024)</li><li>Sao10K: Llama 3.1 Euryale 70B v2.2</li><li>Nous: Hermes 3 70B Instruct</li><li>Nous: Hermes 3 405B Instruct</li><li>Sao10K: Llama 3 8B Lunaris</li><li>OpenAI: GPT-4o (2024-08-06)</li><li>Meta: Llama 3.1 70B Instruct</li><li>Meta: Llama 3.1 8B Instruct</li><li>Mistral: Mistral Nemo</li><li>OpenAI: GPT-4o-mini</li><li>OpenAI: GPT-4o-mini (2024-07-18)</li><li>Google: Gemma 2 27B</li><li>OpenAI: GPT-4o</li><li>OpenAI: GPT-4o (2024-05-13)</li><li>Mistral: Mixtral 8x22B Instruct</li><li>WizardLM-2 8x22B</li><li>OpenAI: GPT-4 Turbo ($$$$)</li><li>Anthropic: Claude 3 Haiku</li><li>Mistral Large</li><li>OpenAI: GPT-3.5 Turbo (older v0613)</li><li>OpenAI: GPT-4 Turbo Preview ($$$$)</li><li>OpenRouter Auto Router</li><li>OpenAI: GPT-3.5 Turbo Instruct</li><li>OpenAI: GPT-3.5 Turbo 16k</li><li>Mancer: Weaver (alpha)</li><li>ReMM SLERP 13B</li><li>MythoMax 13B</li><li>OpenAI: GPT-3.5 Turbo</li><li>OpenAI: GPT-4 ($$$$)</li><li>Stealth: Qwen3.6 Plus (50% off)</li><li>Stealth: Claude Opus 4.8 (20% off)</li><li>Stealth: Claude Opus 4.7 (20% off)</li><li>Stealth: Claude Sonnet 4.6 (20% off)</li><li>Stealth: Claude Opus 4.6 (20% off)</li><li>Auto Small</li></ul></details></div>
</details>
</div>

<!-- inference:openrouter:end -->

The selected route is the lowest modeled cost in the captured endpoints with status `0`, advertised tool support and explicit cache-read pricing. Nonzero-status routes are excluded from selection; the Xiaomi Pro author quote is retained only in the dataset and quote CSV for comparison. MiniMax M3's lower GMICloud quote is excluded because its endpoint metadata does not advertise tool support. These are dated quotes, not a promise of availability or default routing. The snapshot records provider tags, context limits, quantization, rate overrides and source URLs in the [price dataset](/data/inference-plans/prices.json). Reported discounts are already reflected in endpoint prices and are not applied again. [Endpoint API](https://openrouter.ai/docs/api/api-reference/endpoints/list-all-endpoints-for-a-model)

**Headline input prices can pick the wrong provider.** MiMo V2.5's DeepInfra route quotes $0.13/M fresh input, below Xiaomi's $0.14/M. But its cache-read price is $0.026/M versus Xiaomi's $0.0028/M. Including their output rates and the purchase fee, this measured workload costs **$7.34 through DeepInfra versus $1.99 through Xiaomi**. The API quote, provider tag and context limits for that example are retained in the dataset. [MiMo provider quotes](https://openrouter.ai/xiaomi/mimo-v2.5/providers)

Reproducing the measured 96.53% input cache-hit rate is an assumption. OpenRouter uses sticky routing to help preserve caches, but fallback can move requests to a different provider. Verify actual billed cache reads in the coding harness. Pinning a provider or quantization changes the available routes; an FP4 quote is not evidence of equal application quality to an FP8 or author-hosted route. Each request must also fit that endpoint's context and pricing tier. [Caching](https://openrouter.ai/docs/guides/best-practices/prompt-caching), [provider routing](https://openrouter.ai/docs/guides/routing/provider-selection)

GLM Flash's current OpenRouter quotes include promotional pricing; the author's offer ends **September 9 at 16:00 UTC**. Standing subscription estimates above exclude temporary quota boosts. DeepSeek comparisons pin OpenRouter's Flash `0731` and Pro `0813` versions; a subscription's generic alias may not guarantee the same checkpoint. The author-route DeepSeek quotes are off-peak. Sonnet uses standard service and five-minute cache creation. Recheck these conditions before extending the estimates beyond this snapshot.

At full modeled utilization, **OpenCode Go's MiMo allocation buys about 6.33× the tokens per dollar of the selected OpenRouter route**, and Z.ai Max's off-peak GLM-5.3 allocation buys about **7.73×**. The advantage is smaller for Synthetic GLM Flash against current promotional OpenRouter quotes. Chutes Pro's conditional DeepSeek Flash ceiling is actually more expensive than the selected StreamLake quote. These are different serving configurations, so accepted-work testing still decides whether the cheaper tokens help.

OpenRouter is therefore a useful baseline and overflow source. A subscription only beats it when enough relevant allowance is consumed: Go's MiMo allocation breaks even at **15.8% utilization**, while Synthetic's Flash example needs about **73.6%** against the current selected quote. The [OpenRouter comparison CSV](/data/inference-plans/openrouter-comparison.csv) includes cash-budget token capacity; the [subscription comparison CSV](/data/inference-plans/openrouter-plans.csv) includes savings and break-even utilization for every mapped, quantifiable offer.

## Convert the allowance before comparing it

Z.ai illustrates why a flat subscription cannot be reduced to one universal token price. Credits depend on the selected model, uncached input, cached input, output and time of day. Off-peak model usage consumes half the normal credits.

Applying its [credit formula](https://docs.z.ai/devpack/overview) to the example workload gives these **fully utilized, off-peak, steady-state 30-day equivalents**:

<!-- inference:zai:start -->

<div class="inference-record-list inference-zai-list" role="region" aria-label="Z.ai modeled allowance">
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title">Lite</span><span class="inference-record-metric"><strong>7.7×</strong><small> API value</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Monthly fee</dt><dd>$18</dd></div><div><dt>GLM-5.3 output + input</dt><dd>2.0M + 430M</dd></div><div><dt>Direct API equivalent</dt><dd>$138</dd></div><div><dt>Value multiple</dt><dd>7.7×</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title">Pro</span><span class="inference-record-metric"><strong>10.3×</strong><small> API value</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Monthly fee</dt><dd>$80</dd></div><div><dt>GLM-5.3 output + input</dt><dd>12.1M + 2581M</dd></div><div><dt>Direct API equivalent</dt><dd>$826</dd></div><div><dt>Value multiple</dt><dd>10.3×</dd></div></dl></div>
</details>
<details class="inference-record">
<summary class="inference-record-summary"><span class="inference-record-title">Max</span><span class="inference-record-metric"><strong>11.5×</strong><small> API value</small></span></summary>
<div class="inference-record-details"><dl class="inference-facts"><div><dt>Monthly fee</dt><dd>$168</dd></div><div><dt>GLM-5.3 output + input</dt><dd>28.2M + 6021M</dd></div><div><dt>Direct API equivalent</dt><dd>$1,928</dd></div><div><dt>Value multiple</dt><dd>11.5×</dd></div></dl></div>
</details>
</div>

<!-- inference:zai:end -->

The weekly allowance is prorated for comparison; it is not a guaranteed calendar-month entitlement. Five-hour limits, concurrency, tool consumption and uneven demand can reduce realized value. All-peak operation halves the token allowances. The same subscriptions produce approximately **2.6–4.0× ordinary GLM Flash API value** in this scenario, because Flash's direct API is already much cheaper.

OpenCode Go has a different mechanism. Some models receive six times the subscription fee in API allowance; others receive three or one-and-a-half times. Allocating its entire qualifying allowance to MiMo V2.5 supports approximately **31.7M output plus 6.76B input tokens for $10** in this scenario. Allocating it to MiniMax M3 supports approximately **3.8M output plus 811M input**. Those are alternative uses of one pool, still subject to shorter limits. [Allowance rules](https://opencode.ai/docs/go/)

MiMo's own plan shows the danger of reading credits as tokens. Each uncached V2.5 input token costs 100 credits; each output token costs 200. Its 4.1B-credit Lite plan therefore represents approximately **$5.74 of daytime direct API usage for a $6 fee**, or $7.18 with the off-peak credit discount. Large numbers need units. [Conversion rules](https://mimo.mi.com/docs/en-US/price/token-plan), [API prices](https://mimo.mi.com/docs/en-US/price/pay-as-you-go)

Synthetic's $24 weekly allowance represents about $103 per 30 days **at Synthetic's rates**. Always compare the serving provider's cache prices and model configuration with the original API before calling that a direct-provider discount. [Limits](https://synthetic.new/rate-limits), [model metadata and prices](https://api.synthetic.new/openai/v1/models)

NanoGPT illustrates the effect of counting cache hits at full input weight. At the measured ratio, its 60M weekly input-unit allowance yields approximately **258M total processed tokens, including 1.21M output, per 30 days** on a 1× model. A 2× model halves those estimates. A request-count plan needs another measurement—tokens per billable request—before it can be converted. The local message count is not assumed to equal provider API calls. [NanoGPT quota definitions](https://nano-gpt.com/help)

Utilization is the other half of the arithmetic. A $10 plan containing $60 of relevant API usage breaks even once it replaces more than $10 of API spending. The unused $50 has no value. More packs can buy parallelism, but idle parallelism is still a bill.

## Native coding subscriptions belong in the trial too

Codex through ChatGPT, Claude Code, Cursor and Copilot can be economical when their native workflows produce useful results. Their included allowances are not interchangeable general API credits, and published limits do not establish a universal cost per token.

- **Codex through ChatGPT:** $20/$100/$200 options, with model-dependent five-hour and weekly allowances. API billing is separate. [Pricing](https://learn.chatgpt.com/docs/pricing)
- **Claude Code:** Pro $20, Max from $100. Personal native use and product integrations have different access rules. [Pricing](https://claude.com/pricing), [usage rules](https://code.claude.com/docs/en/legal-and-compliance)
- **Cursor:** $20/$60/$200, with distinct usage pools for Cursor models and other models. [Pricing documentation](https://cursor.com/docs/models-and-pricing)
- **Copilot:** $10/$39/$100 plans advertise $15/$70/$200 total feature credits, including variable flex credits. [Plans](https://github.com/features/copilot/plans)
- **Gemini CLI:** the free Google-account tier advertises up to 1,000 requests daily, subject to model availability and shared limits. It is a useful free baseline. [Quotas](https://geminicli.com/docs/resources/quota-and-pricing/)

## Temporary offers, kept separate

As checked September 7, Z.ai's GLM-5.3-Flash direct API is half price until **September 9 at 16:00 UTC**. That promotional row is explicitly separated from ordinary pricing above. [API offer](https://docs.z.ai/guides/overview/pricing)

Through **September 20**, Z.ai also advertises zero-quota Flash use through ZCode daily **15:00–01:00 UTC**, and doubled quota through other supported agents during that window. OpenCode separately advertises a temporary Flash allowance increase. These offers can improve a trial; the standing subscription calculations exclude them. After expiry, treat this paragraph as a dated observation until it is revised. [Z.ai campaign](https://docs.z.ai/devpack/notice/event-glm-5.3-flash), [OpenCode campaign](https://opencode.ai/go)

## The next analysis should measure accepted work

Run 20–50 representative tasks through the same harness, tests and retry budget. Record input, cache hits, billed output, subscription consumption, cash spend, retries, queue time, review time and whether the change was accepted. Include abandoned attempts in the bill.

The metric is **total inference and retry cost divided by changes that pass tests and review**. Report elapsed time alongside it: a cheap queue can become expensive when it delays everything else. Allocate the full subscription fee across the measured period, including unused quota, rather than claiming the theoretical maximum discount.

That experiment may favor a cheap default with occasional stronger calls. It may favor one reliable model that finishes sooner. This initial research does not establish which outcome the fleet will produce.

## Reproduce and update the comparison

Download the [dated price dataset](/data/inference-plans/prices.json), [measured usage profile](/data/inference-plans/usage-profile.json), [model catalogs](/data/inference-plans/model-catalogs.json), [calculator](/data/inference-plans/calculate.mjs), [API comparison CSV](/data/inference-plans/api-comparison.csv), [plan capacity CSV](/data/inference-plans/plan-capacity.csv), [Z.ai comparison CSV](/data/inference-plans/z-ai-comparison.csv), [OpenRouter quote CSV](/data/inference-plans/openrouter-comparison.csv), and [OpenRouter versus subscriptions CSV](/data/inference-plans/openrouter-plans.csv). The dataset records source URLs and check dates; the artifact's comparisons and CSVs are generated from it.

Put `calculate.mjs` and `prices.json` in the same directory. With Node 22 or newer:

```bash
node calculate.mjs --format api > api.csv
node calculate.mjs --format plans > capacity.csv
node calculate.mjs --format zai > zai.csv
node calculate.mjs --format openrouter > openrouter.csv
node calculate.mjs --format openrouter-plans > openrouter-plans.csv
# Sensitivity scenario; defaults above use the measured profile.
node calculate.mjs --ratio 50 --cache-hit 0.95 --cache-write-share 0.2 --format plans
```

`--cache-write-share` is the fraction of non-cache-read input spent creating caches. It preserves separate write pricing while `--cache-hit` controls reads as a fraction of all input. The calculator does not convert a message count into requests.

For OpenRouter, `--topup-credits 10` models the fee on a $10 inference-credit purchase; `--budget` remains a cash budget. The default amortizes a $100 credit purchase. Ratio overrides reprice the captured provider routes; they do not select a new cheapest provider. Use the recorded endpoint API URLs to refresh route selection for a different workload.

Future revisions can add measured task outcomes, new providers, different cache-hit scenarios and throughput observations without moving this artifact. The page-level verification date advances only after the comparison has been checked as a whole; partial refreshes retain individual source dates. Corrections and changed recommendations belong in the changelog, newest first.

## Changelog

### 2026-09-07 — Published as a data artifact

- Retired the private Notes draft and published the maintained comparison at `/data/inference-plans/`.
- Kept the report, Markdown twin, calculator, source data and generated CSVs together under one public artifact path.
- This changes the publication surface only; the analysis, measurement and source-verification dates are unchanged.

### 2026-09-07 — Display the analysis date

- Added a prominent analysis date near the top of the artifact, separate from publication, measurement and source-verification dates.

### 2026-09-07 — Index by subscription and model

- Reorganized the OpenRouter comparison into all twelve researched coding subscriptions, then their models, with tier and time-window rows underneath.
- Included the saved model catalogs; large unpriced catalogs expand within the relevant subscription instead of disappearing from the comparison.
- Added token capacity beside each calculated model/tier cost and retained explicit unknowns for missing allowances, rates and model multipliers.
- Preserved the existing measured mix and dated prices; this is a coverage and presentation update, not a source refresh.

### 2026-09-07 — OpenRouter route comparison

- Added nine model comparisons using coherent provider quotes, measured cache composition and the standard credit-purchase fee.
- Added selected provider, quantization, context and status metadata; separated flagged author quotes and current promotional rates.
- Added OpenRouter cash-budget capacity and subscription savings/break-even CSVs, plus a configurable top-up size.
- Found that provider cache pricing can reverse headline-price rankings, and that the selected DeepSeek Flash route undercuts Chutes Pro's modeled ceiling.
- Retained the earlier usage measurement and subscription snapshot; this revision refreshes OpenRouter quotes only.

### 2026-09-07 — Normalize subscription costs

- Converted the measured mix into effective costs per million processed tokens and per million output tokens including associated input for every quantifiable offer.
- Added a main normalization table, expandable model/time-window calculations and matching CSV fields.
- Added explicit same-model direct API savings and break-even utilization, preserving negative savings and unknown comparisons.
- Kept the existing measurement and dated price snapshot; this revision adds arithmetic rather than claiming a new measurement or source refresh.

### 2026-09-07 — Measured usage, supported models and capacity

- Replaced the illustrative 20:1 input/output ratio and 80% cache-hit assumption with a fresh local measurement: 213.2:1 and 96.53% of input from cache.
- Normalized separately reported reasoning into billable output and retained distinct cache-read and cache-write buckets.
- Added model coverage for every plan in the main table, dated catalog snapshots and reproducible token-capacity estimates using serving-provider rates.
- Kept unknown quotas, unmetered service and conditional ceilings explicit; added downloadable usage and capacity data.
- Recalculated API examples. The shortlist remains a set of trial candidates; no accepted-work benchmark has yet been run.

### 2026-09-07 — Initial research draft

- Compared twelve subscription offerings with direct API costs and native coding alternatives.
- Added reproducible API and Z.ai calculations, source-check dates, and explicit workload assumptions.
- Recorded automation restrictions, conflicting reseller documentation and expiring promotions.
- Established the cost-per-accepted-change experiment as the next analysis; no paid performance benchmark has been run for this note.