<?xml version='1.0' encoding='utf-8'?>
<feed xmlns="http://www.w3.org/2005/Atom">
  <title>benchr — AI model reviews and field guides</title>
  <id>https://benchr.org/</id>
  <link href="https://benchr.org/atom.xml" rel="self" />
  <link href="https://benchr.org/" rel="alternate" />
  <updated>2026-09-08T00:00:00Z</updated>
  <author>
    <name>The benchr team</name>
  </author>
  <entry>
    <title>Kimi K2.7-Code: fewer thinking tokens, and a flat 2x for speed</title>
    <id>https://benchr.org/articles/kimi-k2-7-code-review</id>
    <link href="https://benchr.org/articles/kimi-k2-7-code-review" rel="alternate" />
    <published>2026-09-08T00:00:00Z</published>
    <updated>2026-09-08T00:00:00Z</updated>
    <summary>Moonshot</summary>
  </entry>
  <entry>
    <title>DeepSeek-V4-Flash-Vision-Exp: vision at no premium</title>
    <id>https://benchr.org/articles/deepseek-v4-flash-vision-exp-review</id>
    <link href="https://benchr.org/articles/deepseek-v4-flash-vision-exp-review" rel="alternate" />
    <published>2026-09-07T00:00:00Z</published>
    <updated>2026-09-07T00:00:00Z</updated>
    <summary>DeepSeek charges nothing extra for image input on this checkpoint. What you trade is stability: it is experimental and has no published license.</summary>
  </entry>
  <entry>
    <title>Gemini 3.8 Flash: same rate card, different bill</title>
    <id>https://benchr.org/articles/gemini-3-8-flash-review</id>
    <link href="https://benchr.org/articles/gemini-3-8-flash-review" rel="alternate" />
    <published>2026-09-07T00:00:00Z</published>
    <updated>2026-09-07T00:00:00Z</updated>
    <summary>Gemini 3.8 Flash is priced to the cent like 3.7 Flash. Google says it spends more tokens on purpose, which is where the cost difference lives.</summary>
  </entry>
  <entry>
    <title>Claude Fable 5.1: cheaper cache reads, stricter contract</title>
    <id>https://benchr.org/articles/claude-fable-5-1-migration</id>
    <link href="https://benchr.org/articles/claude-fable-5-1-migration" rel="alternate" />
    <published>2026-09-02T00:00:00Z</published>
    <updated>2026-09-02T00:00:00Z</updated>
    <summary>Claude Fable 5.1 keeps the $10/$50 API rate and 1M context, cuts cache reads to $0.25 per 1M tokens, and changes forced-tool and thinking behavior.</summary>
  </entry>
  <entry>
    <title>DeepSeek's peak pricing: the clock is now part of the bill</title>
    <id>https://benchr.org/articles/deepseek-peak-pricing</id>
    <link href="https://benchr.org/articles/deepseek-peak-pricing" rel="alternate" />
    <published>2026-08-28T00:00:00Z</published>
    <updated>2026-08-28T00:00:00Z</updated>
    <summary>DeepSeek raised V4 API prices on August 16, 2026 and split every rate into peak and off-peak halves. V4-Flash output went from $0.28 to $1.32 during peak hours.</summary>
  </entry>
  <entry>
    <title>Gemini 3.7 Flash pricing: the same rate as 3.6 Flash</title>
    <id>https://benchr.org/articles/gemini-3-7-flash-price-parity</id>
    <link href="https://benchr.org/articles/gemini-3-7-flash-price-parity" rel="alternate" />
    <published>2026-08-24T00:00:00Z</published>
    <updated>2026-08-24T00:00:00Z</updated>
    <summary>Gemini 3.7 Flash went GA on August 13, 2026 at $0.75/$3.75 per 1M tokens, the same rate 3.6 Flash was cut to. Both return to $1.50/$7.50 on January 1, 2027.</summary>
  </entry>
  <entry>
    <title>Gemini 3.7 Flash: introductory pricing and migration</title>
    <id>https://benchr.org/articles/gemini-3-7-flash-review</id>
    <link href="https://benchr.org/articles/gemini-3-7-flash-review" rel="alternate" />
    <published>2026-08-21T00:00:00Z</published>
    <updated>2026-08-21T00:00:00Z</updated>
    <summary>Google&amp;#x27;s stable multimodal model starts at $0.75/$3.75 through 2026, with a 1M-token window and a dated price change.</summary>
  </entry>
  <entry>
    <title>GLM-5.3: 1M coding, hosted now with weights pending</title>
    <id>https://benchr.org/articles/glm-5-3-review</id>
    <link href="https://benchr.org/articles/glm-5-3-review" rel="alternate" />
    <published>2026-08-21T00:00:00Z</published>
    <updated>2026-08-21T00:00:00Z</updated>
    <summary>Z.AI&amp;#x27;s API release adds post-training gains, always-on reasoning, and three compatible protocols at $1.40/$4.40.</summary>
  </entry>
  <entry>
    <title>Grok 4.6: 500K agent model with no numeric output ceiling</title>
    <id>https://benchr.org/articles/grok-4-6-review</id>
    <link href="https://benchr.org/articles/grok-4-6-review" rel="alternate" />
    <published>2026-08-21T00:00:00Z</published>
    <updated>2026-08-21T00:00:00Z</updated>
    <summary>Grok 4.6 targets long coding agents, starts at $2/$6, doubles at 200K prompt tokens, and has no numeric text-output cap.</summary>
  </entry>
  <entry>
    <title>Kimi K3: 2.8T open-weight MoE with 104B active</title>
    <id>https://benchr.org/articles/kimi-k3-review</id>
    <link href="https://benchr.org/articles/kimi-k3-review" rel="alternate" />
    <published>2026-08-21T00:00:00Z</published>
    <updated>2026-08-21T00:00:00Z</updated>
    <summary>Moonshot&amp;#x27;s sparse agent model pairs a 1M context with flat hosted pricing and a deployment decision bigger than the token rate.</summary>
  </entry>
  <entry>
    <title>DeepSeek's old API aliases are retired: a migration checklist</title>
    <id>https://benchr.org/articles/deepseek-api-aliases-retired</id>
    <link href="https://benchr.org/articles/deepseek-api-aliases-retired" rel="alternate" />
    <published>2026-08-14T00:00:00Z</published>
    <updated>2026-08-14T00:00:00Z</updated>
    <summary>DeepSeek retired deepseek-chat and deepseek-reasoner on July 24, 2026. Replace them with explicit V4 model IDs and validate before shipping.</summary>
  </entry>
  <entry>
    <title>GLM-5.2, reviewed</title>
    <id>https://benchr.org/articles/glm-5-2-review</id>
    <link href="https://benchr.org/articles/glm-5-2-review" rel="alternate" />
    <published>2026-08-08T00:00:00Z</published>
    <updated>2026-08-08T00:00:00Z</updated>
    <summary>GLM-5.2 review: Zhipu</summary>
  </entry>
  <entry>
    <title>Grok 4.5, reviewed</title>
    <id>https://benchr.org/articles/grok-4-5-review</id>
    <link href="https://benchr.org/articles/grok-4-5-review" rel="alternate" />
    <published>2026-08-08T00:00:00Z</published>
    <updated>2026-08-08T00:00:00Z</updated>
    <summary>Grok 4.5 review: xAI</summary>
  </entry>
  <entry>
    <title>OpenAI Presence enterprise agent service</title>
    <id>https://benchr.org/articles/openai-presence-enterprise-agents</id>
    <link href="https://benchr.org/articles/openai-presence-enterprise-agents" rel="alternate" />
    <published>2026-08-04T00:00:00Z</published>
    <updated>2026-08-04T00:00:00Z</updated>
    <summary>OpenAI Presence bundles voice and chat agents with policies, evaluations, approved actions, and escalation. What buyers know—and what remains undisclosed.</summary>
  </entry>
  <entry>
    <title>Claude Opus 5: the migration question behind Anthropic's new flagship</title>
    <id>https://benchr.org/articles/claude-opus-5-review</id>
    <link href="https://benchr.org/articles/claude-opus-5-review" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>The same $5/$25 list price, a 1M-token window, and one configuration change that can break a careless upgrade.</summary>
  </entry>
  <entry>
    <title>Gemini 3.1 Flash TTS Preview: steerable speech with preview boundaries</title>
    <id>https://benchr.org/articles/gemini-3-1-flash-tts-preview-review</id>
    <link href="https://benchr.org/articles/gemini-3-1-flash-tts-preview-review" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>Google</summary>
  </entry>
  <entry>
    <title>Gemini 3.5 Flash-Lite: the $0.30 subagent target has a migration cost</title>
    <id>https://benchr.org/articles/gemini-3-5-flash-lite-review</id>
    <link href="https://benchr.org/articles/gemini-3-5-flash-lite-review" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>Google</summary>
  </entry>
  <entry>
    <title>Gemma 4 26B A4B IT: the MoE choice that still needs real VRAM</title>
    <id>https://benchr.org/articles/gemma-4-26b-a4b-it-launch</id>
    <link href="https://benchr.org/articles/gemma-4-26b-a4b-it-launch" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>Only 3.8B parameters activate per token, but all 25.2B weights stay loaded. Here is the deployment decision behind Gemma 4 26B A4B IT.</summary>
  </entry>
  <entry>
    <title>Gemma 4 31B IT: the dense quality-first choice</title>
    <id>https://benchr.org/articles/gemma-4-31b-it-launch</id>
    <link href="https://benchr.org/articles/gemma-4-31b-it-launch" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>Gemma 4 31B IT review: dense architecture, official memory estimates, 256K context, sibling results, deployment fit, and when to avoid it.</summary>
  </entry>
  <entry>
    <title>GPT-Live-1 is a ChatGPT Voice rollout, not an API endpoint</title>
    <id>https://benchr.org/articles/gpt-live-1-launch</id>
    <link href="https://benchr.org/articles/gpt-live-1-launch" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>OpenAI</summary>
  </entry>
  <entry>
    <title>GPT-Live-1 mini: the Voice fallback is not a developer SKU</title>
    <id>https://benchr.org/articles/gpt-live-1-mini-launch</id>
    <link href="https://benchr.org/articles/gpt-live-1-mini-launch" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>OpenAI</summary>
  </entry>
  <entry>
    <title>GPT-Realtime-2.1 mini review: voice quality and cost</title>
    <id>https://benchr.org/articles/gpt-realtime-2-1-mini-review</id>
    <link href="https://benchr.org/articles/gpt-realtime-2-1-mini-review" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>OpenAI</summary>
  </entry>
  <entry>
    <title>GPT-Realtime-2.1 review: voice loop, latency, and cost</title>
    <id>https://benchr.org/articles/gpt-realtime-2-1-review</id>
    <link href="https://benchr.org/articles/gpt-realtime-2-1-review" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>OpenAI</summary>
  </entry>
  <entry>
    <title>Leanstral 1.5 review: proof benchmarks in context</title>
    <id>https://benchr.org/articles/leanstral-1-5-review</id>
    <link href="https://benchr.org/articles/leanstral-1-5-review" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>Mistral</summary>
  </entry>
  <entry>
    <title>Muse Image: Meta's consumer launch leaves a developer checklist blank</title>
    <id>https://benchr.org/articles/muse-image-launch</id>
    <link href="https://benchr.org/articles/muse-image-launch" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>The image model is available in Meta AI, but the checked announcement gives developers no public model ID, rate card, or token limits.</summary>
  </entry>
  <entry>
    <title>Muse Video Preview: native audio, access, and limits</title>
    <id>https://benchr.org/articles/muse-video-preview-launch</id>
    <link href="https://benchr.org/articles/muse-video-preview-launch" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>Meta previewed a video model with native audio alongside Muse Image, while leaving public developer terms unannounced.</summary>
  </entry>
  <entry>
    <title>Qwen-Audio 3.0 TTS Flash review: latency and cloning</title>
    <id>https://benchr.org/articles/qwen-audio-3-0-tts-flash-review</id>
    <link href="https://benchr.org/articles/qwen-audio-3-0-tts-flash-review" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>Alibaba</summary>
  </entry>
  <entry>
    <title>Qwen-Audio 3.0 TTS Plus: built-in voices are the product boundary</title>
    <id>https://benchr.org/articles/qwen-audio-3-0-tts-plus-review</id>
    <link href="https://benchr.org/articles/qwen-audio-3-0-tts-plus-review" rel="alternate" />
    <published>2026-07-28T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>Alibaba</summary>
  </entry>
  <entry>
    <title>Gemini 3.6 Flash launch: cheaper output, same Flash input</title>
    <id>https://benchr.org/articles/gemini-3-6-flash-launch</id>
    <link href="https://benchr.org/articles/gemini-3-6-flash-launch" rel="alternate" />
    <published>2026-07-22T00:00:00Z</published>
    <updated>2026-08-24T00:00:00Z</updated>
    <summary>Google released Gemini 3.6 Flash on July 21, 2026 at $1.50/$7.50, then halved both rates to $0.75/$3.75 through December 31, 2026.</summary>
  </entry>
  <entry>
    <title>Claude Sonnet 5: Mythos-class architecture at Sonnet pricing</title>
    <id>https://benchr.org/articles/claude-sonnet-5-launch</id>
    <link href="https://benchr.org/articles/claude-sonnet-5-launch" rel="alternate" />
    <published>2026-07-01T00:00:00Z</published>
    <updated>2026-08-31T00:00:00Z</updated>
    <summary>Claude Sonnet 5 launched July 1, 2026 at $2/$10 per 1M — a rate Anthropic made standard on August 31, cancelling the planned September rise to $3/$15.</summary>
  </entry>
  <entry>
    <title>Correction: Gemini 3.5 Pro has not been released</title>
    <id>https://benchr.org/articles/gemini-3-5-pro-review</id>
    <link href="https://benchr.org/articles/gemini-3-5-pro-review" rel="alternate" />
    <published>2026-07-01T00:00:00Z</published>
    <updated>2026-07-29T00:00:00Z</updated>
    <summary>benchr previously published a review and pricing page for</summary>
  </entry>
  <entry>
    <title>GPT-5.6 Sol, Terra, and Luna: launch and API pricing</title>
    <id>https://benchr.org/articles/gpt-5-6-launch</id>
    <link href="https://benchr.org/articles/gpt-5-6-launch" rel="alternate" />
    <published>2026-06-28T00:00:00Z</published>
    <updated>2026-08-24T00:00:00Z</updated>
    <summary>GPT-5.6 (Sol, Terra, Luna) is generally available via the OpenAI API. Terra and Luna got cheaper on July 30, 2026, verified against OpenAI</summary>
  </entry>
  <entry>
    <title>How to fine-tune an open model without owning a GPU</title>
    <id>https://benchr.org/articles/fine-tune-open-model-no-gpu</id>
    <link href="https://benchr.org/articles/fine-tune-open-model-no-gpu" rel="alternate" />
    <published>2026-06-19T00:00:00Z</published>
    <updated>2026-07-23T00:00:00Z</updated>
    <summary>A practical QLoRA guide for fine-tuning 7B–70B open models on rented GPUs, with clearly labeled June 2026 planning scenarios.</summary>
  </entry>
  <entry>
    <title>“CUDA out of memory”: why it happens and how to fix it</title>
    <id>https://benchr.org/articles/cuda-out-of-memory</id>
    <link href="https://benchr.org/articles/cuda-out-of-memory" rel="alternate" />
    <published>2026-06-19T00:00:00Z</published>
    <updated>2026-06-19T00:00:00Z</updated>
    <summary>The five real causes of the CUDA out of memory error when you serve an LLM, the fixes in order from free to last resort, and when you just need a bigger GPU.</summary>
  </entry>
  <entry>
    <title>Your computer can't run the big open models. Here's what works.</title>
    <id>https://benchr.org/articles/run-big-models-without-a-gpu</id>
    <link href="https://benchr.org/articles/run-big-models-without-a-gpu" rel="alternate" />
    <published>2026-06-19T00:00:00Z</published>
    <updated>2026-06-19T00:00:00Z</updated>
    <summary>Why DeepSeek and Llama 70B won</summary>
  </entry>
  <entry>
    <title>Self-hosting vs API cost: when renting a GPU wins</title>
    <id>https://benchr.org/articles/self-host-vs-api-gpu-cost</id>
    <link href="https://benchr.org/articles/self-host-vs-api-gpu-cost" rel="alternate" />
    <published>2026-06-19T00:00:00Z</published>
    <updated>2026-06-19T00:00:00Z</updated>
    <summary>The honest break-even math for self-hosting an open model on a rented GPU versus a per-token API, and why utilization, not the sticker price, decides it.</summary>
  </entry>
  <entry>
    <title>The U.S. Pulled Claude Fable 5 and Mythos 5: What It Means</title>
    <id>https://benchr.org/articles/fable-mythos-export-control</id>
    <link href="https://benchr.org/articles/fable-mythos-export-control" rel="alternate" />
    <published>2026-06-16T00:00:00Z</published>
    <updated>2026-07-30T00:00:00Z</updated>
    <summary>The complete June 2026 Fable 5 and Mythos 5 export-control timeline: suspended June 12, controls lifted June 30, access restored July 1, and what developers…</summary>
  </entry>
  <entry>
    <title>Claude Fable 5 vs GPT-5.5 vs Gemini 3.1 Pro</title>
    <id>https://benchr.org/articles/fable-5-vs-gpt-5-5-vs-gemini-3-1-pro</id>
    <link href="https://benchr.org/articles/fable-5-vs-gpt-5-5-vs-gemini-3-1-pro" rel="alternate" />
    <published>2026-06-13T00:00:00Z</published>
    <updated>2026-07-23T00:00:00Z</updated>
    <summary>Claude Fable 5 vs GPT-5.5 vs Gemini 3.1 Pro: the three newest frontier models compared on price, context, published benchmarks, and the right model per use…</summary>
  </entry>
  <entry>
    <title>Which Claude model should you use in 2026?</title>
    <id>https://benchr.org/articles/which-claude-model</id>
    <link href="https://benchr.org/articles/which-claude-model" rel="alternate" />
    <published>2026-06-13T00:00:00Z</published>
    <updated>2026-07-23T00:00:00Z</updated>
    <summary>A decision guide to Anthropic</summary>
  </entry>
  <entry>
    <title>Claude Opus 4.8 vs Gemini 3.1 Pro</title>
    <id>https://benchr.org/articles/opus-4-8-vs-gemini-3-1-pro</id>
    <link href="https://benchr.org/articles/opus-4-8-vs-gemini-3-1-pro" rel="alternate" />
    <published>2026-06-13T00:00:00Z</published>
    <updated>2026-06-13T00:00:00Z</updated>
    <summary>Claude Opus 4.8 vs Gemini 3.1 Pro: Opus leads coding and agentic work, Gemini is ~2.5x cheaper on input and edges abstract reasoning.</summary>
  </entry>
</feed>