Gateway pārvaldīti Evals AI modeļu atlasei: reklamējiet lētākus vai ātrākus modeļus bez klusas regresijas
Modeļu maiņai, izmantojot vairāku modeļu API vārteju, ir nepieciešami pierādījumi, nevis cerība. Veidojiet eval datu kopas no reālām pēdām, novērtējiet kandidātus ar deterministiskām un uz tiesnešiem balstītām pārbaudēm un pieņemiet paaugstināšanas lēmumus par daļu no vārtejas vadības plaknes.
Komandas parasti nepārkāpj AI darbplūsmas, aizstājot modeli ar acīmredzami sliktu modeli. Viņi tos izjauc, veicot saprātīgas maršrutēšanas izmaiņas, kas izskatās lētākas, ātrākas vai pieejamākas, un pēc tam vēlāk atklājot, ka kopsavilkumi ir mazāk ticami, rīku izsaukumi ir nepareizi veidoti vai ir mainīta atteikuma uzvedība nelielas, bet svarīgas nomnieka darba slodzes dēļ.
Praktiskā atbilde ir uztvert eval rezultātus kā veicināšanas artefaktu vārtejā. Pirms modeļa aizstājvārda, nomnieka profila vai maršrutēšanas politikas norāda uz jaunu kandidātu, vārtejai ir jāspēj parādīt, kura datu kopa tika izmantota, kuri greideri ir izpildīti, kā kandidāts salīdzinājumā ar pašreizējo bāzes līniju, kāda bija izmaksu un latentuma ietekme, kas apstiprināja izmaiņas un kā tās atsaukt.
Šajā rakstā ir aprakstīts atsauces modelis vārtejas pārvaldīto AI modeļu atlases modelim. Tajā galvenā uzmanība tiek pievērsta ražošanas kontrolei, nevis etalonu meklēšanai.
Fakti, ieteikumi un prognozes
Fakti: mūsdienu eval rīki var definēt atkārtoti lietojamas novērtēšanas datu kopas, palaist vairākas modeļu konfigurācijas un atgriezt izvades līmeņa vērtēšanas rezultātus, nokārtošanas statusu, pilnvaru skaitu un apkopojumus. Parastie greideru veidi ietver precīzas virkņu pārbaudes, līdzības metriku, shēmu vai aprēķinu pārbaudes un uz modeļiem balstītus greideri. Pāru novērtējumā var salīdzināt kandidātu atbildes ar bāzes līniju, savukārt punktveida novērtējumā tiek novērtēta viena atbilde pret rubriku vai paredzamo atbildi.
Ieteikumi: izmantojiet deterministiskos vērtētājus visur, kur uzdevumam ir skaidrs līgums, piemēram, derīgs JSON, obligātie lauki, atļautās iezīmes, rīka argumenta forma, citātu klātbūtne, atteikuma kategorija vai skaitliskā pielaide. Izmantojiet uz modeļiem balstītus tiesnešus beztermiņa kvalitātes nodrošināšanai tikai pēc tam, kad tie ir pārbaudīti ar nelielu cilvēku novērtētu kopu. Nereklamējiet modeli tikai no publiska etalona; reklamējiet to, izmantojot pierādījumus, kas saistīti ar jūsu pēdām, nomniekiem, rīkiem, budžetiem un kļūmju režīmiem.
Prognozes: modeļa reklamēšana no ad hoc lietojumprogrammu lēmumiem tiks pārvietota uz vārtejas vadības plaknēm, jo vārtejas jau satur modeļu katalogu, maršrutēšanas noteikumus, lietošanas pēdas, nomnieku politikas un norēķinu datus, kas nepieciešami, lai modeļa izmaiņas būtu auditējamas. Komandas, kas nošķir evals no maršrutēšanas, joprojām veiks pārbaudes, taču tām būs grūti pierādīt, kuri pierādījumi apstiprina reāllaika aizstājvārda maiņu.
Lasītāja problēma: maršrutēšanas izmaiņām ir nepieciešami pierādījumi
Vairāku modeļu API ļauj viegli mainīt mērķa modeli. Tas ir noderīgi, bet rada arī kontroles problēmu. Komanda var vēlēties aizstāt dārgo atbalsta kopsavilkuma modeli ar lētāku kandidātu, pievienot rezerves modeli pieejamībai, pārvietot kodēšanas uzdevumus uz ātrāku modeli vai novirzīt zemas prioritātes nomniekus uz zemāku izmaksu līmeni.
Katrai izmaiņai ir atšķirīgs riska profils. Lētākā apkopotājā var tikt izlaista informācija par eskalāciju. Ātrāks klasifikators var nepareizi apstrādāt retas etiķetes. Atkāpšanās modelī var izmantot citu rīku izsaukuma formātu. Jaunāks argumentācijas modelis var uzlabot sarežģītos gadījumus, vienlaikus palielinot p95 latentumu. Pakalpojumu sniedzēja izlaiduma piezīmes un publiskie uzvarētāju saraksti nevar atbildēt, vai šie kompromisi ir pieņemami konkrētai lietojumprogrammai.
Vārteja ir dabiska vieta, kur novērst šo plaisu, jo tajā ir redzami pieprasījumi, atbildes, nomnieki, atslēgas, aizstājvārdi, izmaksas, latentums, kļūdu līmenis, rīku izsaukumi un politikas lēmumi. Vārtejas pārvaldītie evali pārvērš šo darbības kontekstu par atkārtojamu veicināšanas darbplūsmu.
Atsauces arhitektūra
Praktiskajai arhitektūrai ir septiņas daļas:
- Izsekošanas paraugs: atlasa kandidātu eval vienumus no ražošanas datplūsmas, neveiksmīgiem pieprasījumiem, dārgiem zināmiem pieprasījumiem, īrnieku apstiprinātiem piekrišanas gadījumiem un. pārbauda: noņem vai maskē sensitīvus laukus, ievieš nomnieka reģistrēšanas un saglabāšanas politiku un bloķē paraugus, ko nevar izmantot evals.
- Eval datu kopas reģistrs: saglabā nemainīgas datu kopas versijas ar uzdevuma veidu, nomnieka tvērumu, uzvednes veidnes versiju, rīka shēmas versiju, paredzamajām izvadēm, ja ir pieejamas, piemērots modelis: atkārtoti atskaņo datu kopas vienumus attiecībā pret pašreizējo bāzes līniju un vienu vai vairākiem kandidāta modeļiem, izmantojot kontrolētus parametrus.
- Grederi: lieto deterministiskas pārbaudes, uz aprēķiniem balstītu metriku un kalibrētu, uz modeli balstītu spriedumu.
- Reklāmas lēmuma ieraksts: tver novērtēšanas izpildes ID, datu kopas versijas, bāzes līnijas modeļa īpašnieku ID, kandidātu modeļa ID, apstiprinājums un atcelšanas mērķis.
- Aizstājvārds vai maršrutēšanas politikas atjauninājums: tiešraides vārteju atjaunina tikai pēc tam, kad veicināšanas lēmums ir izturējis nepieciešamos vārtus.
Tādējādi evals ir saistīts ar izvietošanu. Eval run nav ziņojums, ko kāds ir ielīmējis tērzēšanas pavedienā.Tas ir vadības plaknes objekts, kas nepieciešams pirms aizstājvārda maiņas, piemēram, support-fast, coding-default vai summarise-cheap.
Trīs datu kopu klases izveide
1. Zelta regresijas lietas
Zelta lietas ir atlasīti piemēri ar gaidāmajām atbildēm vai stingriem veiksmes kritērijiem. Tie ir pietiekami mazi, lai pārskatītu manuāli, un pietiekami stabili, lai tie darbotos katrā piedāvātajā paaugstinājumā.
Izmantojiet tos uzdevumiem ar skaidriem līgumiem: klasifikācija, izvilkšana, strukturēti kopsavilkumi, politikas lēmumi, rīku atlase, maršrutēšanas etiķetes un atteikuma darbība. Zelta vienumam ir jāietver ievade, paredzamā izvade vai rubrika, atļautās variācijas, uzdevuma metadati un visas rīku shēmas, kas nepieciešamas izsaukuma reproducēšanai.
Piemēri lauki:
{
"dataset_item_id": "support-summary-0421",
"task": "support_summary",
"tenant_scope": "shared_redacted",
"input_messages": [...],
"expected_schema": "support_summary_v3",
"required_facts": ["refund_requested", "order_id_present", "escalation_reason"],
"disallowed_content": ["invented_refund_status"],
"prompt_template_version": "support_summary_prompt_2026_08_14"
}2. Ražošanas laikā iegūti malu korpusi
Ražošanas laikā iegūtie gadījumi fiksē kļūmes, kuras sintētiskos testos parasti nepalaiž garām. Labi avoti ir dārgi pieprasījumi, atkārtojumi, manuāla ignorēšana, lietotāju labojumi, zemas ticamības klasifikatora izvadi, shēmas kļūmes, ilgstoša konteksta izsaukumi, pieprasījumi tuvu latentuma ierobežojumiem un nomnieka darbplūsmas ar neparastu rīku izmantošanu.
Konfidencialitātes noteikums ir vienkāršs: ražošanas trases ir noderīgas tikai tad, ja tās ir atļautas. Vārtejai ir jāievieš īrnieka piekrišana, datu saglabāšanas politika, rediģēšanas un dzīvesvietas ierobežojumi, pirms izsekošana tiek ievadīta eval datu kopā. Sensitīviem nomniekiem var būt nepieciešama vides novērtēšanas izpilde, sintētiski ekvivalenti vai rediģētas pēdas, kas noņem neapstrādātas uzvednes un identifikatorus.
3. Sacensību un politikas gadījumi
Sacensību gadījumi pārbauda uzvedību, kas neizdodas zem spiediena: rīka nepareiza izmantošana, tūlītēja injekcija, nedroša atklāšana, atteikuma robežas, slēpti norādījumu konflikti, nepareizi veidoti faili, nederīgi citāti un neskaidri lietotāju pieprasījumi. Šiem gadījumiem nav jābūt dramatiskiem. Tiem ir jāatspoguļo veidi, kā jūsu lietojumprogrammas var izraisīt bojājumus, ja modelis kļūst pārāk pieļaujams, pārāk paklausīgs vai pārāk neuzmanīgs.
Aģentu darbplūsmās iekļaujiet pilnu ziņojumu vēsturi un rīku izsaukuma kontekstu, nevis tikai viena gājiena uzvednes. Kandidāts, kurš labi atbild uz viena gājiena jautājumu, joprojām var neizdoties, ja viņam ir jāpārbauda rīka rezultāti, jāsaglabā autoritātes robežas un jāiesniedz derīgi argumenti pakārtotajai darbībai.
Vispirms izmantojiet deterministiskos greiderus
Sāciet ar greideriem, kuriem nav nepieciešams spriests. Tie ir lētāki, ātrāki, vieglāk atkļūdojami un mazāk pakļauti novirzīšanai.
Noderīgas deterministiskās pārbaudes ietver:
- JSON sekmīgi parsē un atbilst vajadzīgajai shēmai.
- Ir nepieciešamie lauki, un aizliegts lauks netiek rādīts.
- Klasifikācijas izvade ir viena no atļautajām atbilžu iezīmēm, kas ir pieņemtas. .. pielaide.
- Nomniekam un darbplūsmai ir atļauts rīka nosaukums.
- Rīka argumenti iztur shēmas validāciju un politikas pārbaudes.
- Atbildē ir iekļauti obligātie citāti vai avota identifikatori.
- Atbildē nav iekļautas zināmas aizliegtas frāzes, noslēpumi vai iekšējie marķieri.> atteikuma kategorijai jāatbilstatteikuma pārbaudei. stingri veicināšanas vārti. Ja kandidāts nevar izveidot derīgu strukturētu izvadi vai drošus rīku izsaukumus, labam beztermiņa rakstīšanas rezultātam to nevajadzētu glābt.
- Uzticība: vai kopsavilkumā netiek pievienoti fakti, kas nav ietverti sarunā?
- Tajā ir iekļauta atbilstošā problēma, pasūtījuma izpilde un atbilstība, klienta pieprasījuma informācija: Nākamais solis?
- Rīcība: vai aģents to var izmantot, atkārtoti neizlasot visu pavedienu?
- Politikas atbilstība: vai tā ļauj izvairīties no neapstiprināto atmaksu, kredītu vai eskalāciju solīšanas?
- Kvalitātes nokārtošanas rādītājs: to datu kopas vienumu procentuālā daļa, kas šķērso nepieciešamos deterministiskos un rubrikas vārtus.
- Pāra uzvaras līmenis attiecībā uz kandidātu un pašreizējo bāzes līniju: kvalitāte.
- p95 latentums: mērīts saskaņā ar reprezentatīviem vārtejas iestatījumiem.
- Aptuvenās izmaksas par veiksmīgu uzdevumu: kopējās aptuvenās izmaksas, kas dalītas ar pieņemtajiem rezultātiem, nevis neapstrādātiem izsaukumiem.
- Strukturētās izvades derīgums: shēmas izmantošanas ātrums un labošanas ātrums, atļautais rīks, derīgs arguments, rīks T: derīgsT: politikai atbilstošu darbību atlase.
- Drošība vai politikas kļūmes: atteikumi, nedrošas pabeigšanas, datu noplūdes marķieri vai īrnieka politikas pārkāpumi.
- Darbības saderība: straumēšanas darbība, apturēšanas secības, pilnvaru ierobežojumi, taimauta un veiksmīga atbilde nekā pakalpojumu sniedzēja uzdevums.
- Izveidojiet datu kopas versiju
support_summary_eval_2026_09_02ar 200 zelta futrāļiem, 300 rediģētiem ražošanas malas gadījumiem un 100 pretrunīgiem gadījumiem un 100 sacensību pamatpolitikas gadījumiem, izmantojot to pašu pašreizējo kandidātu pamatlīniju. veidne, shēma, maksimālās izvades pilnvaras un rīka pieejamība. - Lietojiet deterministiskus vārtus: JSON derīgums 99 procenti vai augstāks, obligātais faktu segums — 97 procenti vai lielāks, nulle aizliegtu atmaksas solījumu un nulle nederīgu rīka darbību.
- Lietojiet uz modeli balstītu pāru vērtējumu tikai tiem vienumiem, kas iztur vairāk deterministiskās pārbaudes . definētu kvalitātes rezervi salīdzinājumā ar bāzes līniju, palikt zem pašreizējā p95 latentuma budžeta un samazināt aptuvenās izmaksas par pieņemto kopsavilkumu.
- Ierakstiet novērtēšanas izpildes ID, datu kopas versiju, greideru versijas, kandidāta modeļa ID, bāzes modeļa ID, sliekšņus, apstiprinātāju un atcelšanas aizstājvārda mērķi.
- Kanāriju klāsts, pēc tam izvērsiet aizstājvārdu, lai ierobežotu labojumus, pēc tam izvērsiet aizstājvārdu vai atbalstu ierobežotai shēmai. atpakaļ.
- Paaugstināšanas ID un ID < nemaināma ID datu kopa un datu kopa, eval, dataset . izcelsme.
- Pamata modeļa ID un kandidāta modeļa ID.
- Uzvednes veidnes versija un parametru kopa.
- Rīka shēmas versijas un maršrutēšanas ierobežojumi.
- Graderu nosaukumi, versijas, sliekšņi un kalibrēšanas piezīmes.
- Apkopotie rezultāti.
- Apkopotie atsauces rezultāti. aprēķini.
- Īrnieka tvērums un izlaišanas tvērums.
- Apstiprinātājs, laikspiedols un atcelšanas mērķis.
- Runted gatevalcesway vidē bez mitinātāja. eval produkti.
- Izmantojiet rediģētas pēdas, kas saglabā struktūru un atteices režīmu, bet noņem sensitīvos laukus.
- Izveidojiet sintētiskus gadījumus no novērotajiem atteices modeļiem, nekopējot ražošanas saturu.
- Definējiet modeļa paaugstināšanu kā vadības plaknes darbplūsmu, nevis piezīmjdatora uzdevumu.
- Versiju datu kopas, uzvednes, rīku shēmas, greideri un sliekšņi.
- Atsevišķi zelta, ražošanas atvasinātie gadījumi un aund>
. uz modeļiem balstīti tiesneši. - Kalibrējiet tiesnešus pret cilvēku novērtētiem paraugiem, lai veiktu augstas ietekmes darbplūsmas.
- Novērtējiet maksu par pieņemto uzdevumu, ne tikai maksu par marķieri.
- Pieprasiet atcelšanas mērķus pirms aizstājvārdu vai maršrutēšanas politikas izmaiņām.
- Saglabājiet veicināšanas ierakstus, lai veiktu revīzijas, residences piekrišanu un incidentu atzīšanu. >>>> uz izsekojamību balstītiem novērtējumiem.
- Sekojiet dzīvajiem kanārijputniem, jo evals samazina risku, bet to nenovērš.
Uzmanīgi izmantojiet uz modeļiem balstītus tiesnešus
Atvērtajiem uzdevumiem joprojām ir nepieciešams kvalitatīvs vērtējums. Kopsavilkumi var būt patiesi, bet ne precīzi. Atbalsta atbildēm var būt nepieciešams tonis, pilnība un politikas saskaņošana. Kodēšanas palīdzībai var būt nepieciešams pāru salīdzinājums ar pamata atbildi.
Šajā līmenī ir noderīgi uz modeļiem balstīti tiesneši, taču tos nevajadzētu uzskatīt par objektīvu patiesību. Kalibrējiet tos pret nelielu cilvēku novērtētu paraugu, pirms tie bloķē vai apstiprina ražošanas izmaiņas. Pārbaudiet, vai tiesnesis pietiekami bieži piekrīt cilvēku etiķetēm darbplūsmas riska līmenim.Tiesnešiem pa pāriem uzmanieties, vai nav nosliece uz pozīciju, priekšroka dodama daudzvārdībai un nepamana, ka abas atbildes ir nepieņemamas.
Praktiska tiesneša rubrika atbalsta kopsavilkumam var novērtēt:
Paaugstināšanai apvienojiet minimālos punktus ar salīdzināšanu pa pāriem. Uzvaras koeficients pa pāriem ir noderīgs, aizstājot bāzes līniju, taču tas var slēpt absolūtas neveiksmes, ja abas atbildes ir sliktas. Kandidātam ir jāatbilst minimālajām prasībām, lai pāru kvalitāte izlemtu, vai tā ir labāka, līdzvērtīga vai sliktāka par pašreizējo modeli.
Definējiet veicināšanas rādītāju karti
Vārtejas paaugstināšanas rādītāju kartē ir jāapvieno kvalitāte, latentums, izmaksas un darbības drošība. Precīzi sliekšņi ir atkarīgi no darba slodzes, taču rezultātu kartei ir jābūt precīzai pirms palaišanas sākuma.
Katram kandidāta modelim izsekojiet:
Piemērs: atbalsta apkopojuma modeļa aizstāšana
Pieņemsim, ka pašreizējais aizstājvārds support-fast norāda uz augstas izmaksas modeli, ko izmanto, lai apkopotu klientu sarunas stingrā JSON objektā. Komanda vēlas reklamēt lētāku kandidātu.
Reklamēšanas darbplūsma varētu izskatīties šādi:
Galvenais ir tas, ka kandidāts netiek pieņemts, jo tas ir lētāk. Tas tiek pieņemts tikai tad, ja novērtēšanas pierādījumi liecina, ka lētākais modelis paliek uzdevuma līgumā.
Padarīt veicināšanas ierakstus nemainīgus
Vārtejai jāsaglabā pietiekami detalizēta informācija, lai atbildētu uz vēlāku negadījuma jautājumu: kāpēc šis modelis tika reklamēts?
Paaugstināšanas lēmuma ierakstā ir jāietver:
Tas ir īpaši svarīgi aizstājvārdiem.Ja lietojumprogrammu komandas izsauc support-fast, nevis sniedzēja modeļa ID, tās iegūst stabilitāti, taču vārtejai tagad ir pienākums pierādīt, ka aizstājvārdu izmaiņas tika regulētas.
Privātuma un saglabāšanas vadīklas
Ražošanas izsekošanas evals ievieš konfidencialitātes pienākumus. Izsekošanas paraugu ņēmējam nekad nevajadzētu apiet nomnieka politiku tikai tāpēc, ka evals ir iekšējs. Pirms eval vienuma glabāšanas vai eksportēšanas pārbaudiet, vai var saglabāt neapstrādātas uzvednes, vai ir atļauti pakalpojumu sniedzēja viesotie eval rīki, vai datiem ir jāpaliek noteiktā reģionā un vai paraugā nav ietverti noslēpumi, regulēti dati vai klientu identifikatori.
Sensitīvām darba slodzēm izmantojiet vienu no trim drošākiem modeļiem:
Kompromiss ir reāls. Ražošanas atvasinātie novērtējumi uztver darba slodzei raksturīgās regresijas. Sintētiskie evali samazina iedarbību. Lielākajai daļai komandu ir nepieciešami abi.
Ieviešanas kontrolsaraksts
Secinājums
AI modeļa izvēle nedrīkst būt atkarīga no publiskiem etaloniem, piezīmēm par laidienu vai viena izstrādātāja rokasgrāmatas salīdzinājuma. Vairāku modeļu API vārtejā modeļa izmaiņas ietekmē nomniekus, budžetus, latentumu, rīku darbību, strukturētus rezultātus un drošības politiku. Tas padara evals par daļu no ražošanas pārvaldības.
Rīcības modelis ir vienkāršs: reprezentatīvo izsekojumu paraugs, rediģēšana un filtrēšana pēc politikas, eval datu kopas versija, bāzlīnijas un kandidātu palaišana, vispirms novērtējums ar deterministiskām pārbaudēm, beztermiņa kvalitātes noteikšanai izmantojiet kalibrētus vērtētājus, apvienojiet kvalitāti ar latentumu un izmaksām, kā arī pieprasa nemainīgu rezultātu ieraksturezultātu ieraksts vai nemainīšana. lēnāka modeļa pieņemšana. Tā ir modeļa pieņemšana ar pierādījumiem. Lētāki un ātrāki kandidāti joprojām var pāriet uz ražošanu, taču viņiem ir jāpierāda, ka ietaupījumi netiek gūti, veicot klusu uzdevumu regresiju.