Co je LLM router?
LLM router je součást systému, která u každého požadavku rozhodne, který jazykový model na něj odpoví. Stojí mezi aplikací a sadou modelů: požadavek si přečte, vybere cíl, pošle ho tam a vrátí odpověď.
Rozhodovat se dá trojím způsobem. Router postavený na pravidlech se řídí typem úlohy nebo příznakem, který aplikace už zná. Router s klasifikátorem ohodnotí, jak náročný prompt je, a podle toho vybere. K hodnocení mu obvykle stačí malý model. Kaskádový router zkusí nejdřív levný model a výš postoupí jen tehdy, když odpověď neprojde kontrolou. V provozu se nejčastěji potkáte s kombinací: jednoduchá vrstva pravidel a k ní jeden ze zbylých dvou přístupů.
Směrování bývá součástí AI gateway, hned vedle ověřování, limitů a logování. Může ale běžet i jako samostatná služba nebo jako knihovna přímo v aplikaci.
Lidsky řečeno
Vzpomeňte si na triáž na pohotovosti. Nikdo neposílá každého pacienta rovnou k chirurgovi. Sestra případ posoudí, rozbité koleno ošetří na místě a bolest na hrudi odvede ke specialistovi. LLM router dělá s prompty totéž: krátce se podívá a pak vybere nejlevnější možnost, která práci ještě odvede dobře.
Proč na tom záleží
- Náklady. Většina požadavků v reálném produktu je jednoduchá. Když je všechny pošlete největšímu modelu, platíte příplatek za práci, kterou by správně odvedl i malý model.
- Rychlost. Menší model odpoví dřív. Nejvíc je to vidět v chatu a všude, kde na odpověď čeká člověk.
- Volnost vyměnit model. Aplikace mluví s routerem, ne s SDK jednoho dodavatele. Přidat model nebo jeden vyměnit je pak otázka konfigurace.
- Náhradní cesta. Když je dodavatel nedostupný nebo narazíte na jeho limity, router pošle stejný požadavek jinam, místo aby celé volání spadlo.
Na co si dát pozor
- Router stojí víc, než ušetří. Klasifikátor, který přidá 300 ms a vlastní volání modelu, vám celou úsporu sebere. Měřte celou cestu požadavku, ne jen samotný model.
- Kvalita klesne tam, kam se nedíváte. Souhrnné číslo zakryje jednu špatně směrovanou skupinu požadavků. Vyhodnocujte každou cestu zvlášť, ne jen celek.
- Směrování podle slabého signálu. Délka promptu není náročnost. Krátká otázka může potřebovat hluboké uvažování, dlouhý výpis logů skoro žádné.
- Přepnutí modelu, které nikde nevidíte. Když nepoznáte, který model odpověděl, nedohledáte příčinu nahlášené chyby. Rozhodnutí routeru proto logujte ke každé odpovědi.
- Záměna routeru s gateway. Gateway jsou jedny vstupní dveře: pro všechny služby za nimi řeší ověření, limity a logování. Router vybírá model. Jeden produkt často umí obojí, pořád jsou to ale dvě různé role.
Související články
- Co je to LLM? - Modely, mezi kterými router vybírá.
- Co je API gateway? - Vzor, na kterém AI gateway staví.
- Co je AI inference? - Co se děje, když vybraný model požadavek dostane.
- Co je LLM observabilita? - Jak zjistíte, jestli bylo rozhodnutí routeru dobré.
- Co je token v AI? - Jednotka, ve které se rozdíl v ceně měří.
Chcete být o krok napřed?
Nenechte si utéct naše nejlepší postřehy. Žádný spam, jen praktické analýzy, pozvánky na exkluzivní eventy a shrnutí podcastů přímo do vaší schránky.
