TSM - IA-ul tău a trecut testul dar nu înseamnă că este pregătit de realitate

Horatiu Marc - Head of Solutions & Pre-Sales Engineering @ Global App Testing

Să construiești un produs IA este un lucru. Să știi dacă este cu adevărat pregătit pentru clienți este cu totul altceva. Am petrecut o parte semnificativă din timpul meu în săli de ședințe - și mai recent, în apeluri video - cu echipe de inginerie care au făcut totul corect. Luni de muncă. Prompt engineering atent, sisteme de retrieval, optimizare a latenței, comparații de benchmarkuri. Într-un mediu controlat, produsul arată excelent. Scorurile sunt bune. Demonstrațiile merg fără probleme.

Și apoi vin utilizatorii reali.

Ei aduc ceva ce este foarte greu de simulat într-un laborator: ambiguitatea. Pun întrebări în moduri neașteptate. Schimbă direcția la mijlocul unei conversații. Folosesc argou, umor și limbaj specific culturii lor. Înțeleg greșit instrucțiunile - sau le înțeleg perfect și le sfidează deliberat. Încearcă să convingă modelul să-și încalce propriile reguli.

Din perspectiva soluțiilor, aceasta este problema la care revin în aproape fiecare proiect de IA. Un model capabil nu este același lucru cu un produs pregătit. Iar "pregătit" nu este o stare binară, confirmată o singură dată în timpul dezvoltării. Este ceva ce trebuie câștigat - și menținut continuu - prin dovezi culese de la oameni reali, în condiții reale.

Exact asta este conceput să ofere AI GroundTruth, serviciul de evaluare umană a produselor IA de la Global App Testing.

Mediul controlat de laborator versus complexitatea interacțiunii umane din lumea reală - decalajul în centrul pregătirii IA.

Decalajul despre care nimeni nu vorbește suficient

Există un decalaj în dezvoltarea produselor IA căruia nu i se acordă suficientă atenție. Se situează între o evaluare reușită a modelului și o experiență reușită a utilizatorului final. Eu îl numesc ultimul kilometru - și din experiența mea, acesta este locul în care încrederea se prăbușește în liniște.

Modelul poate fi capabil. Arhitectura poate funcționa. Aplicația poate trece testele automate cu rezultate bune. Cu toate acestea, utilizatorii vor descoperi modalități de interacțiune cu sistemul pe care creatorii săi nu le-au anticipat niciodată. Vor găsi cazuri-limită pe care niciun set de date comparative nu le-a conținut vreodată.

Evaluările comparative și telemetria îți spun ce s-a întâmplat. Rareori îți spun cum gândesc utilizatorii reali ai produsului - sau de ce. Același prompt nu produce întotdeauna același răspuns. Comportamentul se poate schimba pe măsură ce o conversație devine mai lungă. Un chatbot poate obține scoruri bune la testele de acuratețe și totuși să frustreze exact utilizatorii pentru care a fost creat. Un asistent de suport ar putea furniza informații corecte din punct de vedere factual, dar pe un ton complet greșit. O IA educațională ar putea fi prea capabilă - atât de capabilă încât ajunge să facă teme evaluate în locul studenților, în loc să îi ghideze.

Acestea nu sunt eșecuri inginerești în sensul tradițional. Există incompatibilități între ceea ce face modelul și ceea ce ar trebui să facă produsul.

"Un model capabil nu este același lucru cu un produs pregătit. Pregătirea trebuie câștigată - și menținută continuu - prin evaluările și părerile utilizatorilor finali, în condiții reale."

Puntea dintre succesul datelor și experiența clientului din lumea reală se construiește încă la nivelul întregii industrii.

Ce se întâmplă când utilizatorii încep să testeze limitele?

Boundary erosion - o limită care rezistă la prima interacțiune poate ceda discret la a zecea.

Colaborarea Global App Testing cu platforma de învățare digitală Perlego este un studiu de caz la care revin des, pentru că surprinde această problemă cu mare precizie.

Perlego a dezvoltat un "Asistent de Cercetare IA" pentru a ajuta studenții să găsească cărți și să exploreze subiecte academice. Din perspectiva designului de produs, asistentul trebuia să urmeze o linie foarte specifică: cu adevărat util, dar incapabil să realizeze lucrări academice evaluate în locul studenților. Trebuia să recomande cărți fără să inventeze surse. Trebuia să rămână în ecosistemul Perlego, să gestioneze situațiile sensibile în mod adecvat și să reziste tentativelor de a-i ocoli regulile.

Înainte ca asistentul să fie lansat complet, Perlego a colaborat cu Global App Testing pentru a evalua comportamentul acestuia în condiții realiste. Evaluatorii noștri au folosit întrebări autentice și au purtat conversații extinse - și au provocat deliberat asistentul. Tocmai acest ultim element a produs unele dintre cele mai importante constatări.

Unul dintre cele mai mari riscuri identificate a fost ceea ce GAT numește boundary erosion - erodarea limitelor. Asistentul putea refuza cu succes o cerere evidentă, cum ar fi redactarea unui eseu. Dar conversațiile nu se opresc, de obicei, la o singură cerere. Un student ar putea pune o altă întrebare. Apoi alta. Direcția conversației se schimbă treptat.

În unele cazuri, asistentul care refuzase inițial să realizeze o lucrare academică a ajuns să furnizeze planuri detaliate și, în unele situații, chiar paragrafe generate. Nimic nu funcționase incorect în sensul tehnic convențional. Modelul răspundea la cereri. Dar din perspectiva Perlego, produsul nu mai funcționa conform regulilor sale inițiale - și acestea nu sunt același lucru.

Evaluatorii au descoperit, de asemenea, că solicitarea asistentului de a adopta anumite personalități putea slăbi anumite restricții. Testele legate de situații de distres ale utilizatorilor au relevat o altă zonă de îmbunătățire: asistentul recunoștea afirmații îngrijorătoare, dar revenea prea repede la asistența academică.

Aceste constatări au oferit echipei de produs Perlego ceva ce o fișă generică de evaluare a modelului nu poate oferi: situații specifice, reproductibile, în care comportamentul s-a deteriorat. Asta a însemnat că puteau lua măsuri țintite - consolidând limitele de siguranță pentru conversații extinse, rafinând gestionarea răspunsurilor sensibile și investigând de ce anumite tehnici conversaționale puteau îndepărta asistentul de la limitele sale intenționate.

O întrebare, patru niveluri de dovezi

Ceea ce apreciez la modul în care AI GroundTruth a fost structurat este că nu tratează evaluarea ca pe un eveniment singular. Este un sistem conectat, cu patru niveluri distincte de capabilitate, fiecare răspunzând la o întrebare diferită care contează în etape diferite ale ciclului de viață al unui produs IA.

01
COMPORTAMENTUL ȘI SIGURANȚA IA-ului
(AI Behaviour & Safety)
"Putem avea încredere în ceea ce spune și face IA-ul?"
02
EXPERIENȚĂ ÎN SCENARII REALE
(Real-world UX & Journeys)
"Oamenii îl pot folosi cu succes în lumea reală?"
03
DATE DIN ACTIVITĂȚI UMANE/REALE
(Human Task Traces & Data)
"Ce exemple umane vor face sistemul mai capabil?"
04
DEZVOLTAREA CONTINUĂ A IA-ului
(Continuous AI Intelligence)
"Ce se schimbă - și unde trebuie să acționăm?"

Comportamentul și siguranța IA abordează întrebarea fundamentală: Putem avea încredere în ceea ce spune și face IA-ul? Aceasta acoperă calitatea răspunsurilor, alinierea, încrederea, bias-ul și testarea adversarială - evaluare structurată, bazată pe criterii clare și ancorată în expertiză culturală și lingvistică.

Experiența utilizatorului în scenarii reale este chiar mai complexă decât atât. Fiindcă un comportament IA bun nu garantează singur o experiență bună a utilizatorului. Acest nivel evaluează modul în care oamenii reali utilizează produsele IA în fluxurile de lucru, piețele, limbile și dispozitivele vizate. Evidențiază eșecurile din parcursul utilizatorului, punctele de fricțiune și decalajul practic dintre ceea ce un produs poate face și ceea ce utilizatorii pot realiza efectiv cu el.

Datele din activități umane/reale sunt la un nivel care este adesea trecut cu vederea în discuțiile despre evaluare. Dataseturile sigure din punct de vedere al drepturilor, controlate calitativ - inclusiv trasee de sarcini înregistrate pe ecran - oferă echipelor exemplele umane de care au nevoie pentru a îmbunătăți capabilitățile și a construi seturi de evaluare mai robuste în timp.

Și apoi există Dezvoltarea continuă a IA-ului: monitorizare continuă după lansare, urmărind modul în care performanța se schimbă pe parcursul lansărilor, piețelor și timpului. Fiindcă munca nu se termină la implementare. Modelele se schimbă. Comportamentul utilizatorilor evoluează. Piețele noi introduc noi cazuri-limită. O singură evaluare pre-lansare nu este suficientă.

Ceea ce găsesc convingător în această arhitectură este că fiecare angajament este și o investiție. Dovezile se acumulează. Tiparele identificate în mai multe studii creează un activ de informații în creștere - unul care face următoarea întrebare mai ușor de răspuns și următoarea decizie mai sigură.

Dimensiunea culturală

120.000+ evaluatori în peste 190 de țări: AI GroundTruth aduce context cultural și lingvistic real în fiecare evaluare.

Când vorbesc cu clienți care se extind la nivel internațional, dimensiunea culturală este un subiect la care revenim mereu. Și este un domeniu în care limitele evaluării automate sunt, cred eu, cele mai evidente.

Rețeaua Global App Testing include peste 120.000 de persoane din peste 190 de țări. Pentru echipele care se pregătesc să lanseze pe piețe noi, aceasta este o capabilitate semnificativă. Un produs IA poate fi corect din punct de vedere lingvistic fără să fie corect din punct de vedere local. Un răspuns care pare politicos într-o țară poate părea distanțat sau nenatural în altă parte. Umorul călătorește distorsionat. Sfaturile pe teme sensibile poartă așteptări culturale foarte diferite în funcție de context.

Un model nu trebuie pur și simplu să "vorbească româna". Un utilizator român trebuie să poată interacționa cu el în mod natural și să primească răspunsuri care au cu adevărat sens în contextul lui. Acesta este un alt tip de pregătire - și necesită utilizatori reali din acel context pentru a o evalua.

Construind IA pentru lumea reală

Întrebarea pe care mi-o pun cel mai des în conversațiile de pre-vânzare nu este "Este modelul tău bun?" Aproape întotdeauna, răspunsul este da. Întrebarea care contează este: va funcționa când utilizatorii reali încep să-l folosească?

Aceasta este o întrebare diferită. Și necesită dovezi diferite.

Evaluarea automată este esențială. Echipele au nevoie de date repetabile, teste de regresie și modalități scalabile de a compara modelele. Dar clienții nu se comportă ca seturile de date sintetice. Negociază cu o IA. Formulează aceeași intenție în douăzeci de moduri diferite. Aduc presupuneri, limbi și așteptări pe care echipa de dezvoltare nu le-a modelat niciodată.

Viziunea din spatele AI GroundTruth este de a face realitatea umană o intrare continuă în modul în care IA-ul este construit, evaluat și implementat - nu un punct de control final înainte de lansare, ci un semnal continuu care modelează decizii mai bune în fiecare etapă.

Pentru mine, acesta este cadrul potrivit pentru direcția în care se îndreaptă dezvoltarea produselor IA. Construirea unui model care poate răspunde la întrebare reprezintă doar o parte a muncii. Întrebarea mai dificilă și mai importantă este dacă se comportă corect - în siguranță, adecvat, util - atunci când un utilizator real, într-un context real, cu intenții reale pe care poate nu le-ai anticipat niciodată, îl întreabă efectiv.

Aceasta este faza finală și decisivă a IA-ului. Și tocmai aici se dă adevărata bătălie!