AI Praxis

Kompanije kojima je AI već napravio problem sada žele još manje ljudske kontrole

Kompanije ubrzano uvode veštačku inteligenciju u poslovne procese, ali novo istraživanje pokazuje zabrinjavajući raskorak između poverenja u automatizaciju i sposobnosti da se njene greške na vreme otkriju.

Prema podacima istraživanja VB Pulse, koje sprovodi američki tehnološki medij VentureBeat, čak 85 odsto kompanija koje su već imale problem nakon što je AI sistem prošao internu evaluaciju planira da dodatno smanji učešće ljudi u procesu kontrole.

Rezultat je posebno zanimljiv jer dolazi upravo od organizacija koje su već iskusile situaciju u kojoj je postojeći sistem provere rekao da je AI spreman – a problem se ipak dogodio u stvarnoj upotrebi.

Istraživanje je deo VentureBeatovog programa VB Pulse, kroz koji ovaj medij prati način na koji kompanije uvode i koriste veštačku inteligenciju. Podaci na kojima se zasniva analiza prikupljeni su od 157 kvalifikovanih ispitanika iz kompanija sa najmanje 100 zaposlenih, odnosno od ljudi uključenih u donošenje tehničkih i poslovnih odluka u vezi sa AI sistemima.

Zbog veličine i strukture uzorka rezultate treba posmatrati kao pokazatelj kretanja među kompanijama koje aktivno koriste AI, a ne kao reprezentativnu sliku svih kompanija na tržištu.

Ipak, podaci otkrivaju veoma važan problem.

AI je prošao test – pa ipak napravio problem

Oko polovine ispitanih kompanija navelo je da je u produkciju pustilo AI agenta ili funkciju zasnovanu na velikom jezičkom modelu koja je prethodno uspešno prošla internu evaluaciju, ali je nakon toga ipak izazvala problem vidljiv korisnicima.

Kod približno četvrtine ispitanika takva situacija dogodila se više puta.

To praktično znači da problem nije nužno u tome što kompanije ne testiraju svoje AI sisteme.

One ih testiraju – ali postojeći testovi očigledno ne uspevaju uvek da predvide ponašanje sistema u stvarnim uslovima.

Upravo tu nastaje ono što VentureBeat opisuje kao „evaluation gap“, odnosno jaz između rezultata koje AI ostvaruje tokom testiranja i njegove pouzdanosti kada počne da radi sa stvarnim korisnicima, podacima i poslovnim procesima.

Samo pet odsto potpuno veruje automatskim proverama

Još zanimljiviji rezultat istraživanja odnosi se na poverenje kompanija u sopstvene sisteme kontrole.

Samo oko pet odsto ispitanika navodi da u potpunosti veruje automatizovanim AI evaluacijama koje koriste pri donošenju odluka o puštanju sistema u produkciju.

Istovremeno, 66 odsto ispitanih kompanija već dozvoljava određene oblike puštanja AI sistema u produkciju bez ljudske provere ili razvija sisteme koji bi trebalo da funkcionišu na taj način u narednih 12 meseci.

Drugim rečima, kompanije ubrzano smanjuju ulogu čoveka iako same priznaju da još nemaju potpuno poverenje u automatizovane mehanizme koji bi čoveka trebalo da zamene.

Tu se nalazi najvažniji zaključak istraživanja.

Zašto kompanije žele da izbace čoveka iz procesa?

Na prvi pogled ovakav rezultat deluje kontradiktorno.

Ako je kompanija već doživela grešku AI sistema, logično bi bilo očekivati da uvede više ljudske kontrole.

U praksi postoji veliki ekonomski problem.

AI sistemi postaju zanimljivi kompanijama upravo zato što mogu da automatizuju ogromnu količinu posla.

Ako AI može da obradi 100.000 zahteva dnevno, ali svaki rezultat mora pojedinačno da proveri zaposleni, značajan deo prednosti automatizacije nestaje.

Zbog toga kompanije razvijaju automatizovane sisteme za evaluaciju.

U najjednostavnijem obliku jedan AI generiše rezultat, dok drugi AI procenjuje da li je taj rezultat dovoljno kvalitetan, bezbedan ili tačan.

Takav pristup često se naziva LLM-as-a-judge.

AI evaluator može da proverava da li odgovor prati instrukcije, da li sadrži potrebne informacije, da li zadovoljava određene kriterijume ili da li rezultat treba poslati na dodatnu proveru.

Problem je što je i evaluator – AI.

Ko proverava AI koji proverava AI?

To postaje jedno od centralnih pitanja praktične primene veštačke inteligencije.

Veliki jezički modeli nisu deterministički sistemi koji će u svakoj situaciji dati potpuno predvidiv rezultat.

AI koji ocenjuje odgovor drugog AI-ja može i sam da pogreši.

Može da propusti problem, pogrešno protumači odgovor ili pozitivno oceni rezultat koji bi čovek odmah prepoznao kao neodgovarajući.

Tada nastaje lanac u kojem jedan AI izvršava zadatak, drugi AI ga kontroliše, a nijedan čovek možda neće videti rezultat pre nego što stigne do korisnika.

Sa običnim chatbotom posledica može biti pogrešan odgovor.

Sa autonomnijim AI agentom posledice mogu biti ozbiljnije.

AI više ne generiše samo tekst

Razlog zbog kojeg pitanje evaluacije postaje toliko važno jeste promena načina na koji kompanije koriste veštačku inteligenciju.

AI više nije samo prozor za razgovor u koji zaposleni postavi pitanje.

Savremeni agenti mogu da dobiju cilj, naprave plan, pristupe dokumentima, koriste poslovne aplikacije, pozivaju druge servise, pišu programski kod i izvrše čitav niz operacija pre nego što vrate rezultat.

Svaki dodatni korak predstavlja još jedno mesto na kojem može da nastane greška.

Ako agent napravi deset uzastopnih odluka, greška u trećem koraku može promeniti sve što se dogodi nakon njega.

Zato tradicionalno testiranje AI modela više nije dovoljno.

Kompanije moraju da proveravaju čitave procese u kojima AI učestvuje.

Samo deo kompanija kontroliše rezultate u realnom vremenu

Podaci VB Pulse istraživanja ukazuju i na još jedan problem.

Prema objavljenim rezultatima, samo oko 23 odsto ispitanih kompanija sprovodi proveru AI izlaza u realnom vremenu.

To je važna razlika.

Jedno je testirati AI sistem pre nego što bude pušten korisnicima.

Potpuno drugo je nadgledati ga nakon što počne da radi.

Model može dobro da prođe stotine unapred pripremljenih testova, a zatim da se u stvarnoj upotrebi susretne sa kombinacijom podataka, instrukcija ili situacija koju razvojni tim nije predvideo.

Upravo zato produkciono praćenje postaje posebno važno za AI agente.

Rešenje verovatno nije ni potpuna ljudska ni potpuna AI kontrola

Rezultati istraživanja ne znače nužno da automatizovana evaluacija ne funkcioniše.

Bez nje bi masovna primena AI sistema u mnogim slučajevima bila praktično nemoguća.

Problem nastaje kada se automatska evaluacija posmatra kao potpuna zamena za druge mehanizme kontrole.

Realističniji sistem može imati nekoliko nivoa.

AI može automatski da proverava većinu standardnih rezultata. Neuobičajeni slučajevi mogu da budu prosleđeni dodatnom modelu. Rezultati sa visokim rizikom ili niskim stepenom sigurnosti mogu automatski da budu poslati čoveku.

Istovremeno, ljudi mogu periodično da pregledaju nasumične uzorke rezultata kako bi proverili da li sam sistem automatske evaluacije funkcioniše kako je zamišljeno.

Čovek tada ne mora da proverava svaki AI odgovor.

Njegova uloga postaje kontrola sistema koji kontroliše AI.

Najvažnije pitanje više nije koliko je AI inteligentan

Podaci VB Pulse istraživanja ukazuju na problem koji bi mogao postati mnogo značajniji kako AI agenti budu dobijali više ovlašćenja.

Dosadašnja trka kompanija OpenAI, Google, Anthropic i drugih uglavnom se pratila kroz pitanje koji model daje najbolje odgovore i ostvaruje najbolje rezultate na testovima.

U poslovnoj primeni pojavljuje se drugačiji kriterijum.

Nije dovoljno da AI može da izvrši zadatak.

Kompanija mora pouzdano da zna da li je zadatak dobro izvršen.

To je posebno važno kada AI komunicira sa korisnicima, obrađuje finansijske ili poslovne podatke, pristupa internim dokumentima, menja programski kod ili samostalno koristi druge digitalne alate.

Istraživanje VentureBeatovog VB Pulse programa zato ukazuje na jedan od paradoksa trenutnog razvoja veštačke inteligencije: kompanije žele sve autonomnije AI sisteme, dok još nisu potpuno rešile pitanje kako će proveravati njihov rad kada čoveka više nema u svakom koraku.

U eri AI agenata možda zato neće biti presudno samo ko napravi najpametniji model.

Jednako važno biće ko napravi sistem kojem možemo da verujemo – i koji ume da prepozna trenutak kada AI ne treba da veruje samom sebi.

Komentari čitalaca

Vaše mišljenje je deo priče

Otvorite diskusiju i budite prvi koji će komentarisati ovu vest.

0 komentara