<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Latency on DevOpsTales</title>
    <link>https://devopstales.github.io/tags/latency/</link>
    <description>Recent content in Latency on DevOpsTales</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>en-US</language>
    <lastBuildDate>Thu, 01 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://devopstales.github.io/tags/latency/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Model Routing: Stop Using One Model for Everything</title>
      <link>https://devopstales.github.io/ai/model-routing-strategies/</link>
      <pubDate>Thu, 01 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://devopstales.github.io/ai/model-routing-strategies/</guid>
      <description>A 70B model summarizing an email burns money; a 3B model reviewing production code courts disaster. Routing matches task complexity to model capability across four strategies — capability, cost, latency, hybrid — each optimizing what hurts most. Production systems converge on hybrid; start there only after one model genuinely fails.
</description>
      <enclosure url="https://devopstales.github.io/img/model-routing-strategies.webp" length="24746" type="image/png" />
    </item>
    
  </channel>
</rss>
