Skip to main content
Recrutare inginerie AI

Model routing: competența de cost AI pe care o angajezi în 2026

Calin Muresan•
#model routing#cost de inferență AI#modele open-weight#angajări AI#Data & AI#Cloud & DevOps

Model routing: competența de cost AI pe care o angajezi în 2026

Rutarea modelelor (model routing) înseamnă să trimiți fiecare cerere AI către cel mai ieftin model care o poate rezolva bine, inclusiv modele open-weight, în loc să trimiți totul către un model frontier. În 2026, Uber, AT&T și Pinterest au raportat costuri de inferență AI cu 34% până la 92% mai mici, fiecare cifră măsurată altfel, din pârghii precum rutarea, caching-ul, limitele de efort, modelele open-weight și post-training-ul. Dacă angajezi pentru roluri de AI platform, applied AI sau DevOps, aceasta este acum o competență pe care trebuie s-o verifici la selecție.

Alegerea unui model AI era o chestiune de furnizor. Semnai cu un provider, iar factura era cât era. În 2026 e o decizie de inginerie și se vede în P&L.

Dovezile au venit în august. Echipa de inginerie Uber a raportat un cost per sesiune cu 52% sub vârful din iunie, în timp ce cererile agentice săptămânale au crescut de 9,4× între februarie și august. AT&T a redus cu până la 56% costul pentru coding și pentru alte câteva sarcini AI avansate. CEO-ul Pinterest le-a spus investitorilor că modelele deschise ale companiei rulează la sub 8% din costul unor modele închise comparabile. The Pragmatic Engineer le-a adunat pe toate trei în ediția The Pulse din 10 septembrie.

Datele de buget confirmă tendința. Sondajul State of FinOps 2026 al FinOps Foundation, făcut pe 1.192 de practicieni, arată că 98% gestionează acum cheltuielile cu AI, față de 31% cu doi ani înainte. Gestionarea costurilor AI a fost setul de competențe pe care respondenții voiau cel mai mult să-l adauge în următoarele 12 luni.

Ghidul acesta explică ce este model routing, de ce acele cifre nu înseamnă același lucru, ce competențe le-au produs și îți dă cinci întrebări de selecție pentru următorul interviu. Suntem foști ingineri software care conduc căutări de Data & AI și Cloud & DevOps, așa că citim sursele așa cum le-ar citi tech lead-ul tău.

Concluzii cheie

  • Model routing trimite fiecare cerere către cel mai ieftin model care atinge pragul de calitate. Uber, AT&T și Pinterest au raportat în 2026 cifre ale costului de inferență AI cu 34–92% mai mici, fiecare pe altă metrică și din mai multe pârghii, nu doar din modele open-weight.
  • Cifrele nu au același numitor: Uber raportează costul per 1.000 de cereri (−34%) și costul per sesiune (−52%), AT&T o reducere „de până la 56%” pe sarcini specifice, iar Pinterest un raport al costului per tranzacție față de modelele închise. Un candidat care citează o economie fără numitor repetă un titlu de presă.
  • Economiile au venit cu compromisuri. AT&T a măsurat o scădere de calitate de 2%. Pinterest își atribuie performanța post-training-ului aplicat modelelor deschise pe propriile date, iar asta e muncă ML de specialitate.
  • Rutarea, caching-ul și post-training-ul sunt trei competențe diferite. Post-training-ul cere o căutare ML separată. Primele două își au locul în rolurile de platform și applied AI pentru care angajezi deja.
  • Nu deschide din reflex un post de „AI FinOps engineer”. Articolul Uber descrie pârghii de cost integrate în munca de inginerie și nu menționează o echipă separată de cost. Adaugă competența în fișele de post existente și testeaz-o.

Ce este model routing?

Model routing este un strat între aplicația ta și modele, care decide ce model servește fiecare cerere. Munca simplă, precum clasificarea, extracția sau un răspuns scurt, merge la un model mic sau open-weight. Raționamentul dificil merge la un model frontier. Routerul poate fi o regulă statică („rezumatele merg la modelul A”) sau un clasificator antrenat care dă mai întâi un scor fiecărei cereri.

Cum se așază un model router între o aplicație și modelele ei O cerere din aplicație intră într-un router care cântărește costul față de calitate și schimbă modelul doar după ce trece de o poartă de evaluare. Routerul folosește un prompt cache, apoi trimite sarcinile simple, cu risc mic, către un model mic sau open-weight, iar sarcinile grele, cu risc mare, către un model frontier. Cerere din aplicație prompt + context Prompt cache Router cost vs. calitate, cu evals Mic / open-weight sarcini simple, risc mic Model frontier sarcini grele, risc mare
Un strat de rutare simplificat. Implementările reale adaugă fallback-uri, rate limiting și logare per model.

Alte două pârghii vin de obicei la pachet cu rutarea și sunt adesea puse în aceeași oală cu ea:

  • Prompt caching: stocarea prefixului deja procesat al unui prompt, astfel încât cererile ulterioare care îl refolosesc să plătească un tarif redus
  • Limite de efort și de context: limitarea implicită a adâncimii de raționament și a dimensiunii contextului, cu ridicarea lor doar când o sarcină o cere

Ține-le separate, atât în minte, cât și în fișa de post. Se bazează pe cunoștințe diferite, iar un candidat poate fi puternic la una și slab la alta. Dacă o singură persoană va deține acest strat cap-coadă, rolul se suprapune mult cu ce face un applied AI engineer zi de zi.

Ce au raportat de fapt Uber, AT&T și Pinterest?

Cifrele raportate merg de la 34% la 92%, dar fiecare companie a măsurat altceva. Rezumatul comod e „modelele deschise taie factura la jumătate”. Sursele primare spun ceva mai util: trei companii, patru cifre, patru numitori, o singură direcție.

Companie Ce au măsurat Cifră Cum Sursă
Uber Costul per 1.000 de cereri către modele ~34% sub vârf (feb.–iul. 2026) Selecție Pareto a modelelor, între frontier și open-weight, prompt caching, limite de efort și de context Uber Engineering, 27 aug. 2026
Uber Costul per sesiune 52% sub vârful din iunie La fel La fel
AT&T Costul pentru coding și alte câteva sarcini AI avansate Cu până la 56% mai mic, la o calitate cu 2% mai scăzută Routere LiteLLM; Nemotron, Llama și Gemma alături de modele Anthropic și OpenAI The Information via PYMNTS, 20 aug. 2026
Pinterest Costul per tranzacție, față de modele închise comparabile Sub 8% din costul modelelor închise (un raport, nu o reducere înainte/după) Modele deschise, unele cu post-training pe datele Pinterest, de exemplu Pinterest Assistant Conferința de rezultate T2 2026, 4 aug. 2026
Cifre raportate ale costului de inferență AI în 2026, pe companie și metrică Grafic cu bare. Barele albastre sunt reduceri față de reperul anterior al fiecărei companii: la Uber, costul per 1.000 de cereri a scăzut cu 34%, iar costul per sesiune cu 52%; la AT&T, costul pentru coding și unele sarcini avansate a scăzut cu până la 56%. Bara aurie este o comparație, nu o reducere: la Pinterest, costul per tranzacție este cu aproximativ 92% mai mic decât al modelelor închise comparabile. Uber · cost per 1.000 cereri Uber · cost per sesiune AT&T · coding + alte sarcini („până la”) Pinterest · vs. modele închise −34%−52%−56%~92% mai mic 0%25%50%75%100% vs. propriul reper anterior vs. modele închise comparabile
Patru cifre, patru numitori. Surse: Uber Engineering (27 aug. 2026); The Information via PYMNTS (20 aug. 2026); conferința de rezultate Pinterest pentru T2 2026 (4 aug. 2026).

De ce nu poți face media cifrelor

Începe cu Uber. În același articol, compania raportează o scădere de 34% a costului per 1.000 de cereri și o scădere de 52% a costului per sesiune. Fereastra de timp și reperul diferă, deci ambele pot fi adevărate simultan. Între timp, Uber spune că cheltuiala totală cu AI „s-a stabilizat relativ din aprilie”, deși între februarie și august cererile agentice săptămânale au crescut de 9,4×, iar utilizatorii activi săptămânali de 7×. (Rezumatul The Pragmatic Engineer spune „din martie”. Articolul Uber spune aprilie, așa că cităm sursa Uber.)

Acesta e primul lucru de înțeles despre această competență. O cifră de cost fără numitor nu este un rezultat. Costul per cerere, per sesiune, per tranzacție și cheltuiala totală se pot mișca în direcții diferite în același trimestru. Un inginer care deține costul de inferență știe pe care dintre ele îl urmărește business-ul.

Articolul Uber dă și o definiție proprie: eficiența Pareto înseamnă „cost/sarcină finalizată, calitatea output-ului și fiabilitatea modelului”. Trei numere, urmărite împreună. Fraza aceea e aproape o fișă de post în sine.

Ce a dat la schimb fiecare companie pentru economie

  • AT&T a acceptat o pierdere de calitate măsurată. Mark Austin, vicepreședintele AT&T care coordonează AI-ul pentru angajați, a estimat-o la 2%. A mai spus că modelele deschise sunt cu 6–10 luni în urma celor frontier. AT&T trimite aproximativ 40% din interogări către modele deschise și țintește 60–70%. A evaluat modele DeepSeek și Moonshot, dar nu le-a adoptat.
  • Pinterest a investit în post-training. CEO-ul Bill Ready a spus că „cu modelele deschise obținem un cost per tranzacție de sub 8% din costul unor modele proprietare închise comparabile”. În aceeași conferință, a pus performanța mai bună pe cazurile de utilizare ale Pinterest pe seama post-training-ului aplicat modelelor deschise pe datele proprii. Cifra de cost vine din modelele deschise. Calitatea care îi permite Pinterest să se bazeze pe ele vine din inginerie ML, nu dintr-o configurație de router.
  • Uber a împărțit munca pe multe pârghii. Articolul descrie un harness care servește „orice model, frontier sau open-weight, în spatele unei singure interfețe”, un benchmark intern construit din mii de pull request-uri reale, prompt caching, o limită de context de 400K tokeni și efort de raționament mediu, implicit. Mai notează că un cache cu durată mai lungă costă mai mult la scriere: 1,25× pentru o intrare de 5 minute, 2× pentru una de o oră.

De ce contează atât de mult modelul ales pentru cost?

Diferențele de preț per apel între modele sunt suficient de mari încât rutarea chiar și a unei părți din trafic schimbă factura. Ediția The Pulse din 10 septembrie a The Pragmatic Engineer a citat o comparație pe code review: cel mai scump model open-weight a costat $0,30 (USD) per review, față de $0,50 pentru cel mai ieftin model frontier și $2,50 pentru cel mai scump.

Costul per code review AI, pe categorii de modele, în USD Grafic lollipop. Cel mai scump model open-weight: $0,30 per review. Cel mai ieftin model frontier: $0,50 per review. Cel mai scump model frontier: $2,50 per review. Open-weight · cel mai scump Frontier · cel mai ieftin Frontier · cel mai scump $0,30$0,50$2,50 $0$0,50$1,00$1,50$2,00$2,50
Costul per code review în USD, citat de The Pragmatic Engineer, „The Pulse”, 10 sept. 2026. Axă liniară.

Aplică aceste prețuri la un volum ilustrativ de 10.000 de review-uri pe lună. Open-weight: $3.000. Frontier: între $5.000 și $25.000. Diferența ajunge la $22.000 pe lună, adică $264.000 pe an.

Ca să captezi această diferență ai nevoie de muncă de rutare și evaluare, nu de cercetare ML. Îți trebuie cineva care poate dovedi că modelul mai ieftin e suficient de bun pentru acel workload și care continuă să dovedească asta pe măsură ce modelele se schimbă. Abordarea Pinterest e diferită. Dacă vrei modele deschise care depășesc modelele închise pe datele tale, angajezi pentru un profil mult mai îngust.

Rutarea, caching-ul și post-training-ul sunt trei competențe diferite

„Reducerea costurilor cu LLM-uri” pare o singură competență într-un anunț de job. În practică sunt trei și vin din background-uri diferite. Aici se strică procesul de angajare.

Competență Cum arată munca Rol tipic Notă de angajare
Model routing și controlul efortului Împărțirea workload-urilor pe niveluri, rularea de evaluări (evals) înainte de schimbarea modelului, setarea valorilor implicite de raționament și context, gestionarea modelelor retrase de furnizori AI platform engineer, applied AI engineer Cere experiență cu LLM-uri în producție; demo-urile nu o pun la încercare
Caching și economia contextului Structurarea prompturilor astfel încât prefixele să intre în cache, alegerea duratei de viață a cache-ului, gruparea în batch a apelurilor mici și dese Backend sau platform engineer Înrudită cu competențele backend existente
Post-training pe modele deschise Fine-tuning pe date proprietare, evaluare, servire pe vLLM, SGLang sau TensorRT-LLM ML engineer Muncă ML de specialitate; bugetează o căutare separată

Uber și AT&T descriu mai ales primele două rânduri. Afirmația Pinterest despre calitate se sprijină pe al treilea. Dacă roadmap-ul tău seamănă cu al Pinterest, bugetează o căutare ML. Ghidul nostru despre angajarea inginerilor ML în România explică ce presupune.

Ce ar trebui să scrie într-o fișă de post de Data & AI sau DevOps?

Scrie responsabilitățile ca răspundere pentru un număr concret, cu un prag de calitate atașat. „Experiență cu LLM-uri” și „prompt engineering” nu descriu nimic după care un candidat să poată fi măsurat.

Rânduri din fișa de post care funcționează:

  1. Deține costul per [cerere / sesiune / tranzacție] pentru [produs sau platformă] și îl raportează săptămânal, alături de o metrică de calitate.
  2. Menține o suită de evaluări care trebuie să treacă înainte ca orice workload să fie mutat pe un model mai ieftin sau open-weight.
  3. Proiectează și operează stratul de rutare (de exemplu, LiteLLM sau un gateway intern) peste modele frontier și open-weight.
  4. Stabilește și revizuiește, per workload, efortul implicit de raționament, limitele de context și politica de caching.
  5. Deține migrările de modele: urmărește retragerile anunțate de furnizori, rulează teste de regresie, livrează schimbarea.
  6. (Doar pentru roluri ML) Face post-training și servește modele deschise pe vLLM, SGLang sau TensorRT-LLM, cu o țintă de cost per tranzacție.

Rânduri de tăiat: „familiaritate cu GPT și Claude”, „prompt engineering”, „pasiune pentru AI”. Niciunul nu-i spune candidatului pentru ce va răspunde și nici nu-ți spune ție ce să testezi.

O notă despre designul rolului. Articolul Uber descrie costul ca parte a muncii de inginerie și nu menționează o echipă FinOps separată sau un titlu de responsabil de cost. Programul AT&T ține de un vicepreședinte responsabil de utilizarea AI de către angajați. Niciuna dintre surse nu arată un „AI FinOps engineer” de sine stătător în spatele rezultatelor. Pentru majoritatea echipelor, varianta mai bună e să adaugi rândurile 1–5 în rolul de AI platform sau applied AI pe care îl ai deja.

Verificare de realitate: „model routing” e o etichetă nouă, așa că nu te aștepta s-o găsești în CV-uri. Testează în schimb comportamentul, cu întrebările de mai jos.

Cinci întrebări care testează judecata despre costul de inferență

Cere mai întâi numitorul, apoi testează calitatea, riscul, economia caching-ului și migrările. Fiecare întrebare țintește un eșec pe care îl poți vedea în sursele de mai sus.

# Întrebare Răspuns solid Semnal de alarmă
1 „Ai redus costul AI cu 50%. Per ce?” Numește numitorul, reperul și ce s-a întâmplat cu cheltuiala totală „Ne-a scăzut factura”
2 „Ce cereri nu ai ruta niciodată către un model open-weight?” Numește workload-urile după risc și costul erorii, apoi spune cum a aflat asta „Modelele deschise sunt la fel de bune acum, deci toate”
3 „Cum ai măsurat calitatea înainte și după schimbare?” O suită de evals, un număr și un prag de acceptare (cei 2% ai AT&T sunt genul de cifră pe care o vrei) „Utilizatorii nu s-au plâns”
4 „Când costă un prompt cache cu durată mai lungă mai mult decât economisește?” Explică faptul că scrierile în cache vin cu un cost suplimentar, deci prefixele de scurtă durată sau puțin refolosite nu își recuperează costul Tratează caching-ul ca pe bani gratis
5 „Un furnizor retrage luna viitoare modelul pe care rulează produsul tău. Descrie-mi pas cu pas ce faci.” Suită de regresie, shadow traffic, rollout etapizat, plan de rollback „Am schimba numele modelului”

Angajarea pentru costul de inferență AI în România și CEE

Caută ingineri care au livrat funcționalități LLM în producție și au trebuit să justifice factura. Cursurile și demo-urile nu vin cu o factură, deci nu pot demonstra această judecată. În practică, asta te duce la fel de mult către ingineri backend și platform care au trecut în applied AI, cât către specialiști ML.

Partea incomodă:

  • Concurezi pentru una dintre cele mai grele angajări din 2026. AI-Native Builder Report 2026 al Christian & Timbers, pe baza datelor Lightcast despre piața muncii, estimează cererea de AI-native builders la 3,4 ori oferta disponibilă în T1 2026. Raportul arată și că aproximativ șapte din zece căutări care se închid o fac prin abordare directă a candidaților pasivi, nu prin aplicații primite. Sunt date la nivelul întregii piețe, nu specifice României, dar companiile care angajează în CEE concurează pentru aceiași oameni.
  • Bugetează salarii reale de inginerie AI. Ghidul nostru despre applied AI engineer plasează salariul orientativ din România pentru inginerii AI la aproximativ €4.900 pe lună pentru mid-level și €8.000 sau mai mult pentru roluri de lead, pe baza datelor ERI, levels.fyi și Glassdoor, care nu se pun de acord asupra brutului față de net. Verifică intervalele pentru ML și AI din ghidul salariilor IT din România 2026 înainte să stabilești bugetul și lasă o marjă dacă planul include post-training.
  • Domeniul se mișcă repede. Estimarea proprie a AT&T este un decalaj de 6–10 luni între modelele deschise și cele frontier, iar Uber scrie că „frontiera se mută la fiecare câteva săptămâni”. Oricine ai angaja va rula din nou evaluări cât timp va fi în rol. Angajează pentru disciplina măsurării, nu pentru cunoașterea modelelor din trimestrul acesta.

Susținem în articolul despre ingineria AI-native că, în echipele AI-native, competența rară este verificarea: să dovedești că output-ul AI e suficient de bun înainte să ai încredere în el. Costul de inferență cere aceeași judecată, aplicată facturii.

Întrebări frecvente

Ce este model routing în AI? Model routing este un strat care trimite fiecare cerere către modelul cel mai potrivit ca raport între cost și calitate. Sarcinile simple merg la modele mici sau open-weight, iar cele grele la modele frontier. De obicei vine împreună cu prompt caching și cu limite pentru efortul de raționament și dimensiunea contextului.

Cât pot reduce modelele open-weight costurile cu LLM-uri? Depinde de metrică și de celelalte pârghii implicate. Cifrele de 34% și 52% ale Uber au venit din mai multe pârghii, nu doar din modele open-weight. Cei 56% ai AT&T sunt o cifră „de până la”, pe sarcini specifice. Cifra Pinterest, sub 8%, este o comparație cu modelele închise, nu o reducere înainte/după.

Scad modelele open-weight calitatea față de modelele frontier? Uneori, așa că măsoar-o în loc s-o presupui. AT&T a măsurat o scădere de calitate de 2% și a estimat că modelele deschise sunt cu 6–10 luni în urma celor frontier. Pinterest a raportat performanțe mai bune pe cazurile sale de utilizare după post-training-ul modelelor deschise pe propriile date.

Am nevoie de un rol de AI FinOps sau poate echipa de platformă să preia asta? Pentru majoritatea echipelor, echipa de platformă sau cea de applied AI poate prelua asta. Articolul Uber descrie aceste pârghii ca parte a muncii de inginerie și nu menționează o echipă separată de cost. Adaugă mai întâi în fișele de post existente responsabilitatea pentru costul per cerere și un prag de evaluare.

Cum intervievez un inginer despre optimizarea costurilor LLM? Începe cu numitorul: întreabă-l per ce a fost măsurată ultima economie de cost pe care a obținut-o. Cele cinci întrebări din tabelul de selecție de mai sus acoperă calitatea, riscul de rutare, caching-ul și migrările.

Concluzia

Model routing a transformat costul de inferență AI dintr-o clauză de contract într-un rezultat de inginerie. Cifrele din august de la Uber, AT&T și Pinterest arată în aceeași direcție, dar măsoară lucruri diferite și vin din tehnici diferite.

Trei lucruri de reținut:

  1. Cere numitorul. Per cerere, per sesiune, per tranzacție și cheltuiala totală sunt rezultate diferite.
  2. Angajează competența, nu un titlu nou. Rutarea și caching-ul își au locul în fișele de post de AI platform și applied AI. Post-training-ul e o căutare ML separată.
  3. Nicio economie fără eval. Pierderea de calitate de 2% a AT&T e genul de număr pe care un inginer bun îl aduce cu el.

Dacă urmează să angajezi un inginer AI care să dețină model routing și costul de inferență, te putem ajuta să scrii fișa de post și să testezi judecata din spatele afirmațiilor. Suntem foști ingineri, așa că selectăm cu întrebările de mai sus. Primești un shortlist atent selectat de trei până la cinci candidați, nu un potop de CV-uri. Spune-ne pe cine angajezi.


Ultima actualizare: 14 septembrie 2026. Surse verificate pe 14 septembrie 2026: Uber Engineering, „Running a Software Factory Efficiently at Uber Scale” (Uday Kiran Medisetty, 27 aug. 2026); The Information via PYMNTS (20 aug. 2026); transcrierea conferinței de rezultate Pinterest pentru T2 2026, The Motley Fool (conferința a avut loc pe 4 aug., transcrierea a fost publicată pe 11 aug. 2026); The Pragmatic Engineer, „The Pulse: tech companies move to open AI models” (10 sept. 2026); FinOps Foundation, State of FinOps 2026; Christian & Timbers, AI-Native Builder Report 2026. Intervalele salariale pentru România provin din ghidul nostru despre applied AI engineer și sunt orientative. Prețurile per code review sunt cele citate de The Pragmatic Engineer. Exemplul cu 10.000 de review-uri pe lună este un calcul ilustrativ pe baza acestor prețuri, nu o implementare raportată.