ABONAMENTE VIDEO REDACȚIA
RO
EN
NOU
Numărul 170
Numărul 169 Numărul 168 Numărul 167 Numărul 166 Numărul 165 Numărul 164 Numărul 163 Numărul 162 Numărul 161 Numărul 160 Numărul 159 Numărul 158 Numărul 157 Numărul 156 Numărul 155 Numărul 154 Numărul 153 Numărul 152 Numărul 151 Numărul 150 Numărul 149 Numărul 148 Numărul 147 Numărul 146 Numărul 145 Numărul 144 Numărul 143 Numărul 142 Numărul 141 Numărul 140 Numărul 139 Numărul 138 Numărul 137 Numărul 136 Numărul 135 Numărul 134 Numărul 133 Numărul 132 Numărul 131 Numărul 130 Numărul 129 Numărul 128 Numărul 127 Numărul 126 Numărul 125 Numărul 124 Numărul 123 Numărul 122 Numărul 121 Numărul 120 Numărul 119 Numărul 118 Numărul 117 Numărul 116 Numărul 115 Numărul 114 Numărul 113 Numărul 112 Numărul 111 Numărul 110 Numărul 109 Numărul 108 Numărul 107 Numărul 106 Numărul 105 Numărul 104 Numărul 103 Numărul 102 Numărul 101 Numărul 100 Numărul 99 Numărul 98 Numărul 97 Numărul 96 Numărul 95 Numărul 94 Numărul 93 Numărul 92 Numărul 91 Numărul 90 Numărul 89 Numărul 88 Numărul 87 Numărul 86 Numărul 85 Numărul 84 Numărul 83 Numărul 82 Numărul 81 Numărul 80 Numărul 79 Numărul 78 Numărul 77 Numărul 76 Numărul 75 Numărul 74 Numărul 73 Numărul 72 Numărul 71 Numărul 70 Numărul 69 Numărul 68 Numărul 67 Numărul 66 Numărul 65 Numărul 64 Numărul 63 Numărul 62 Numărul 61 Numărul 60 Numărul 59 Numărul 58 Numărul 57 Numărul 56 Numărul 55 Numărul 54 Numărul 53 Numărul 52 Numărul 51 Numărul 50 Numărul 49 Numărul 48 Numărul 47 Numărul 46 Numărul 45 Numărul 44 Numărul 43 Numărul 42 Numărul 41 Numărul 40 Numărul 39 Numărul 38 Numărul 37 Numărul 36 Numărul 35 Numărul 34 Numărul 33 Numărul 32 Numărul 31 Numărul 30 Numărul 29 Numărul 28 Numărul 27 Numărul 26 Numărul 25 Numărul 24 Numărul 23 Numărul 22 Numărul 21 Numărul 20 Numărul 19 Numărul 18 Numărul 17 Numărul 16 Numărul 15 Numărul 14 Numărul 13 Numărul 12 Numărul 11 Numărul 10 Numărul 9 Numărul 8 Numărul 7 Numărul 6 Numărul 5 Numărul 4 Numărul 3 Numărul 2 Numărul 1
×
▼ LISTĂ EDIȚII ▼
Numărul 170
Abonamente

IA-ul tău a trecut testul dar nu înseamnă că este pregătit de realitate

Horatiu Marc
Head of Solutions & Pre-Sales Engineering @ Global App Testing



MANAGEMENT

Să construiești un produs IA este un lucru. Să știi dacă este cu adevărat pregătit pentru clienți este cu totul altceva. Am petrecut o parte semnificativă din timpul meu în săli de ședințe - și mai recent, în apeluri video - cu echipe de inginerie care au făcut totul corect. Luni de muncă. Prompt engineering atent, sisteme de retrieval, optimizare a latenței, comparații de benchmarkuri. Într-un mediu controlat, produsul arată excelent. Scorurile sunt bune. Demonstrațiile merg fără probleme.

Și apoi vin utilizatorii reali.

Ei aduc ceva ce este foarte greu de simulat într-un laborator: ambiguitatea. Pun întrebări în moduri neașteptate. Schimbă direcția la mijlocul unei conversații. Folosesc argou, umor și limbaj specific culturii lor. Înțeleg greșit instrucțiunile - sau le înțeleg perfect și le sfidează deliberat. Încearcă să convingă modelul să-și încalce propriile reguli.

Din perspectiva soluțiilor, aceasta este problema la care revin în aproape fiecare proiect de IA. Un model capabil nu este același lucru cu un produs pregătit. Iar "pregătit" nu este o stare binară, confirmată o singură dată în timpul dezvoltării. Este ceva ce trebuie câștigat - și menținut continuu - prin dovezi culese de la oameni reali, în condiții reale.

Exact asta este conceput să ofere AI GroundTruth, serviciul de evaluare umană a produselor IA de la Global App Testing.

Mediul controlat de laborator versus complexitatea interacțiunii umane din lumea reală - decalajul în centrul pregătirii IA.

Decalajul despre care nimeni nu vorbește suficient

Există un decalaj în dezvoltarea produselor IA căruia nu i se acordă suficientă atenție. Se situează între o evaluare reușită a modelului și o experiență reușită a utilizatorului final. Eu îl numesc ultimul kilometru - și din experiența mea, acesta este locul în care încrederea se prăbușește în liniște.

Modelul poate fi capabil. Arhitectura poate funcționa. Aplicația poate trece testele automate cu rezultate bune. Cu toate acestea, utilizatorii vor descoperi modalități de interacțiune cu sistemul pe care creatorii săi nu le-au anticipat niciodată. Vor găsi cazuri-limită pe care niciun set de date comparative nu le-a conținut vreodată.

Evaluările comparative și telemetria îți spun ce s-a întâmplat. Rareori îți spun cum gândesc utilizatorii reali ai produsului - sau de ce. Același prompt nu produce întotdeauna același răspuns. Comportamentul se poate schimba pe măsură ce o conversație devine mai lungă. Un chatbot poate obține scoruri bune la testele de acuratețe și totuși să frustreze exact utilizatorii pentru care a fost creat. Un asistent de suport ar putea furniza informații corecte din punct de vedere factual, dar pe un ton complet greșit. O IA educațională ar putea fi prea capabilă - atât de capabilă încât ajunge să facă teme evaluate în locul studenților, în loc să îi ghideze.

Acestea nu sunt eșecuri inginerești în sensul tradițional. Există incompatibilități între ceea ce face modelul și ceea ce ar trebui să facă produsul.

"Un model capabil nu este același lucru cu un produs pregătit. Pregătirea trebuie câștigată - și menținută continuu - prin evaluările și părerile utilizatorilor finali, în condiții reale."

Puntea dintre succesul datelor și experiența clientului din lumea reală se construiește încă la nivelul întregii industrii.

Ce se întâmplă când utilizatorii încep să testeze limitele?

Boundary erosion - o limită care rezistă la prima interacțiune poate ceda discret la a zecea.

Colaborarea Global App Testing cu platforma de învățare digitală Perlego este un studiu de caz la care revin des, pentru că surprinde această problemă cu mare precizie.

Perlego a dezvoltat un "Asistent de Cercetare IA" pentru a ajuta studenții să găsească cărți și să exploreze subiecte academice. Din perspectiva designului de produs, asistentul trebuia să urmeze o linie foarte specifică: cu adevărat util, dar incapabil să realizeze lucrări academice evaluate în locul studenților. Trebuia să recomande cărți fără să inventeze surse. Trebuia să rămână în ecosistemul Perlego, să gestioneze situațiile sensibile în mod adecvat și să reziste tentativelor de a-i ocoli regulile.

Înainte ca asistentul să fie lansat complet, Perlego a colaborat cu Global App Testing pentru a evalua comportamentul acestuia în condiții realiste. Evaluatorii noștri au folosit întrebări autentice și au purtat conversații extinse - și au provocat deliberat asistentul. Tocmai acest ultim element a produs unele dintre cele mai importante constatări.

Unul dintre cele mai mari riscuri identificate a fost ceea ce GAT numește boundary erosion - erodarea limitelor. Asistentul putea refuza cu succes o cerere evidentă, cum ar fi redactarea unui eseu. Dar conversațiile nu se opresc, de obicei, la o singură cerere. Un student ar putea pune o altă întrebare. Apoi alta. Direcția conversației se schimbă treptat.

În unele cazuri, asistentul care refuzase inițial să realizeze o lucrare academică a ajuns să furnizeze planuri detaliate și, în unele situații, chiar paragrafe generate. Nimic nu funcționase incorect în sensul tehnic convențional. Modelul răspundea la cereri. Dar din perspectiva Perlego, produsul nu mai funcționa conform regulilor sale inițiale - și acestea nu sunt același lucru.

Evaluatorii au descoperit, de asemenea, că solicitarea asistentului de a adopta anumite personalități putea slăbi anumite restricții. Testele legate de situații de distres ale utilizatorilor au relevat o altă zonă de îmbunătățire: asistentul recunoștea afirmații îngrijorătoare, dar revenea prea repede la asistența academică.

Aceste constatări au oferit echipei de produs Perlego ceva ce o fișă generică de evaluare a modelului nu poate oferi: situații specifice, reproductibile, în care comportamentul s-a deteriorat. Asta a însemnat că puteau lua măsuri țintite - consolidând limitele de siguranță pentru conversații extinse, rafinând gestionarea răspunsurilor sensibile și investigând de ce anumite tehnici conversaționale puteau îndepărta asistentul de la limitele sale intenționate.

O întrebare, patru niveluri de dovezi

Ceea ce apreciez la modul în care AI GroundTruth a fost structurat este că nu tratează evaluarea ca pe un eveniment singular. Este un sistem conectat, cu patru niveluri distincte de capabilitate, fiecare răspunzând la o întrebare diferită care contează în etape diferite ale ciclului de viață al unui produs IA.

01
COMPORTAMENTUL ȘI SIGURANȚA IA-ului
(AI Behaviour & Safety)
"Putem avea încredere în ceea ce spune și face IA-ul?"
02
EXPERIENȚĂ ÎN SCENARII REALE
(Real-world UX & Journeys)
"Oamenii îl pot folosi cu succes în lumea reală?"
03
DATE DIN ACTIVITĂȚI UMANE/REALE
(Human Task Traces & Data)
"Ce exemple umane vor face sistemul mai capabil?"
04
DEZVOLTAREA CONTINUĂ A IA-ului
(Continuous AI Intelligence)
"Ce se schimbă - și unde trebuie să acționăm?"

Comportamentul și siguranța IA abordează întrebarea fundamentală: Putem avea încredere în ceea ce spune și face IA-ul? Aceasta acoperă calitatea răspunsurilor, alinierea, încrederea, bias-ul și testarea adversarială - evaluare structurată, bazată pe criterii clare și ancorată în expertiză culturală și lingvistică.

Experiența utilizatorului în scenarii reale este chiar mai complexă decât atât. Fiindcă un comportament IA bun nu garantează singur o experiență bună a utilizatorului. Acest nivel evaluează modul în care oamenii reali utilizează produsele IA în fluxurile de lucru, piețele, limbile și dispozitivele vizate. Evidențiază eșecurile din parcursul utilizatorului, punctele de fricțiune și decalajul practic dintre ceea ce un produs poate face și ceea ce utilizatorii pot realiza efectiv cu el.

Datele din activități umane/reale sunt la un nivel care este adesea trecut cu vederea în discuțiile despre evaluare. Dataseturile sigure din punct de vedere al drepturilor, controlate calitativ - inclusiv trasee de sarcini înregistrate pe ecran - oferă echipelor exemplele umane de care au nevoie pentru a îmbunătăți capabilitățile și a construi seturi de evaluare mai robuste în timp.

Și apoi există Dezvoltarea continuă a IA-ului: monitorizare continuă după lansare, urmărind modul în care performanța se schimbă pe parcursul lansărilor, piețelor și timpului. Fiindcă munca nu se termină la implementare. Modelele se schimbă. Comportamentul utilizatorilor evoluează. Piețele noi introduc noi cazuri-limită. O singură evaluare pre-lansare nu este suficientă.

Ceea ce găsesc convingător în această arhitectură este că fiecare angajament este și o investiție. Dovezile se acumulează. Tiparele identificate în mai multe studii creează un activ de informații în creștere - unul care face următoarea întrebare mai ușor de răspuns și următoarea decizie mai sigură.

Dimensiunea culturală

120.000+ evaluatori în peste 190 de țări: AI GroundTruth aduce context cultural și lingvistic real în fiecare evaluare.

Când vorbesc cu clienți care se extind la nivel internațional, dimensiunea culturală este un subiect la care revenim mereu. Și este un domeniu în care limitele evaluării automate sunt, cred eu, cele mai evidente.

Rețeaua Global App Testing include peste 120.000 de persoane din peste 190 de țări. Pentru echipele care se pregătesc să lanseze pe piețe noi, aceasta este o capabilitate semnificativă. Un produs IA poate fi corect din punct de vedere lingvistic fără să fie corect din punct de vedere local. Un răspuns care pare politicos într-o țară poate părea distanțat sau nenatural în altă parte. Umorul călătorește distorsionat. Sfaturile pe teme sensibile poartă așteptări culturale foarte diferite în funcție de context.

Un model nu trebuie pur și simplu să "vorbească româna". Un utilizator român trebuie să poată interacționa cu el în mod natural și să primească răspunsuri care au cu adevărat sens în contextul lui. Acesta este un alt tip de pregătire - și necesită utilizatori reali din acel context pentru a o evalua.

Construind IA pentru lumea reală

Întrebarea pe care mi-o pun cel mai des în conversațiile de pre-vânzare nu este "Este modelul tău bun?" Aproape întotdeauna, răspunsul este da. Întrebarea care contează este: va funcționa când utilizatorii reali încep să-l folosească?

Aceasta este o întrebare diferită. Și necesită dovezi diferite.

Evaluarea automată este esențială. Echipele au nevoie de date repetabile, teste de regresie și modalități scalabile de a compara modelele. Dar clienții nu se comportă ca seturile de date sintetice. Negociază cu o IA. Formulează aceeași intenție în douăzeci de moduri diferite. Aduc presupuneri, limbi și așteptări pe care echipa de dezvoltare nu le-a modelat niciodată.

Viziunea din spatele AI GroundTruth este de a face realitatea umană o intrare continuă în modul în care IA-ul este construit, evaluat și implementat - nu un punct de control final înainte de lansare, ci un semnal continuu care modelează decizii mai bune în fiecare etapă.

Pentru mine, acesta este cadrul potrivit pentru direcția în care se îndreaptă dezvoltarea produselor IA. Construirea unui model care poate răspunde la întrebare reprezintă doar o parte a muncii. Întrebarea mai dificilă și mai importantă este dacă se comportă corect - în siguranță, adecvat, util - atunci când un utilizator real, într-un context real, cu intenții reale pe care poate nu le-ai anticipat niciodată, îl întreabă efectiv.

Aceasta este faza finală și decisivă a IA-ului. Și tocmai aici se dă adevărata bătălie!

NUMĂRUL 166 - AI for Programmers

Sponsori

  • Banca Transilvania
  • Betfair
  • MHP
  • .msg systems
  • P3 group
  • Cognizant Softvision
  • BMW TechWorks Romania

INTERVIURI