DX Heroes logo
#ai
#machine-learning

Co je LLM-as-a-judge?

Délka: 

6 min

Publikováno: 

26. srpna 2026

Co je LLM-as-a-judge?

Co je LLM-as-a-judge?

LLM-as-a-judge znamená, že výstup jazykového modelu hodnotí jiný jazykový model. Hodnotícímu modelu dáte text k posouzení, kritéria a stupnici. Vrátí verdikt a většinou k němu i zdůvodnění.

Technika vznikla proto, že ostatní možnosti nestačí. U shrnutí, překladu nebo odpovědi zákaznické podpory neexistuje jediný správný řetězec, takže porovnání na přesnou shodu neřekne nic. Člověk text posoudí poctivě, ale na sto vzorků padnou hodiny. To je na testovací sadu příliš pomalé.

Měřitelný základ dal celému postupu jeden článek. Lianmin Zheng a spoluautoři vydali Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena na arXivu v červnu 2023. Verdikty hodnotících modelů porovnali s daty o lidských preferencích. Silné modely se s nimi shodly ve víc než 80 % případů. Podle článku se dva lidé mezi sebou shodnou stejně často.

Právě toto srovnání myšlenku rozšířilo.

Lidsky řečeno

Zadáte písemku a nemáte dost učitelů na opravování. Tak sešity dáte načtenému studentovi a přiložíte klíč, který jste sami napsali. Je rychlý, nestojí skoro nic a pustí se do toho i ve tři ráno. Učil se ale ze stejné učebnice jako celá třída, takže má stejná slepá místa, a nenápadně dává přednost odpovědím, které zní jako ty jeho.

Jak to funguje

Většinu použití v praxi pokryjí tři varianty.

Párové srovnání. Hodnotící model dostane dvě odpovědi na stejný vstup a řekne, která je lepší. Ze všech tří je nejspolehlivější, protože relativní rozhodnutí je snazší než absolutní.

Známkování jedné odpovědi. Modelu dáte jednu odpověď spolu s kritérii a chcete po něm skóre. Je to nejlevnější varianta a nejsnáze se zapojí do pipeline. Dokud ale kritéria nejsou konkrétní, skóre mezi běhy skáče.

Hodnocení podle reference. Dodáte správnou odpověď a ptáte se, jak moc se od ní posuzovaná odpověď odchyluje. Hodí se tam, kde správná odpověď existuje, ale na přesném znění nezáleží.

Ve všech třech případech rozhoduje kvalita kritérií víc než volba modelu. „Je to dobré?“ přinese jen šum. „Jmenuje ta odpověď konkrétní další krok? A objevuje se každé číslo z ní i ve zdrojovém textu?“ dá výsledek, se kterým se dá pracovat.

Kde se to vyplatí

Technika pomůže nejvíc tam, kde jde o velké objemy a jeden špatný verdikt nic nezničí.

  • Regresní testy textu. Změnili jste prompt. Spadla kvalita odpovědí na 500 uložených vstupech? Hodnotící model to řekne za pár minut, a jen proto to vůbec někdo kontroluje.
  • Předfiltr pro lidskou kontrolu. Model seřadí velkou dávku a člověk si pak přečte spodní desetinu.
  • Průběžné vyhodnocování v produkci. Vzorkujete živý provoz, dáváte mu skóre a hlídáte trend. To je ta část LLM observability, která hodnotí.
  • Srovnání dvou modelů. Párové hodnocení na pevné sadě vstupů je rozumný způsob, jak mezi kandidáty vybrat model pro jednu konkrétní úlohu.

Na co si dát pozor

Článek o MT-Benchi pojmenovává čtyři způsoby, jak hodnocení selže, a všechny platí dál: zkreslení pozicí, zkreslení délkou, preference vlastního výstupu a omezená schopnost usuzovat. V praxi to znamená, že model dá přednost odpovědi, kterou viděl první, a ocení délku před obsahem. Přikloní se k textu, který se podobá jeho vlastnímu, a sebejistě známkuje i odpověď na otázku, kterou sám neumí promyslet. Přehledové práce pořád berou spolehlivost hodnotících modelů jako otevřený problém, ne jako vyřešený. Jiawei Gu a spoluautoři stav shrnuli v A Survey on LLM-as-a-Judge, vydaném na arXivu v listopadu 2024.

Obrana existuje a je levná. V párových bězích střídejte pořadí náhodně, nebo pusťte obě pořadí a rozporné případy zahoďte. Nikdy nenechte model známkovat vlastní výstup, pokud si můžete dovolit jiný. Do kritérií dejte limit na délku. Než skóre uvěříte, zkalibrujte ho na stovce příkladů oznámkovaných člověkem. Po výměně hodnotícího modelu kalibraci zopakujte.

Selhání, které kritéria nezachytí

Na jedno omezení jsme narazili sami.

Každý článek v této znalostní bázi projde před vydáním dvěma hodnotícími modely. Jeden ověřuje každé tvrzení podle citovaného zdroje. Druhý odpovídá na sadu redakčních otázek a vrací „prošlo“, nebo „blokuji“.

V srpnu 2026 prošel oběma návrh s číslem, které nikdo neověřil. V textu stálo, že seznam nástrojů v AGENTS.md má víc než 30 položek. Seznam jich jmenoval 23. Oba modely návrh pustily. Naše redakce chybu zachytila ještě před vydáním, ale jen náhodou: někdo otevřel zdrojovou stránku, aby doplnil odkaz, a přitom seznam spočítal.

Nebyla to chyba modelů. Dostaly otázku, jestli má návrh dobré zdroje a jestli si neprotiřečí. V obojím obstál. U každého tvrzení byla citace. Obě jazykové verze si odpovídaly. Ani jeden model si citovanou stránku neotevřel, protože ho o to nikdo nepožádal. A shoda dvou verzí téže chyby vypadá úplně stejně jako potvrzení.

Pravidlo, které jsme si z toho odnesli, je proto úzce vymezené. Hodnotící model známkuje text, který má před sebou, ne svět, o kterém ten text mluví. Špatné číslo na vstupu vyjde špatné i na výstupu. S každou kontrolou, kterou projde, jen vypadá lépe podložené. Ověřit fakt znamená otevřít zdroj. Ten krok nemůžete předat modelu, kterému jste dali jen text.

Totéž platí pro každé vyhodnocování, které si postavíte. Ptejte se, co hodnotící model fyzicky vidí. Kontrola konzistence, tónu a souladu s kritérii leží uvnitř té hranice. Skutečnost, o které text mluví, už ne.


Související články

  • Co je LLM observabilita? - Kam skóre od hodnotícího modelu patří, jakmile ho pouštíte průběžně na živý provoz.
  • Co je to AI halucinace? - Selhání, které má hodnotící model obvykle hledat a kterého se občas dopustí sám.
  • Co je context rot? - Proč se hodnotící model u dlouhých vstupů zhoršuje způsobem, který ze skóre nepoznáte.
  • Co je AI slop? - Co zaplní mezeru, když hodnocení odměňuje plynulost místo obsahu.
  • Co je AGENTS.md? - Ten seznam 23 nástrojů z příkladu výš.

Chcete být o krok napřed?

Nenechte si utéct naše nejlepší postřehy. Žádný spam, jen praktické analýzy, pozvánky na exkluzivní eventy a shrnutí podcastů přímo do vaší schránky.