Peste 1,6 trilioane de dolari – atât ai fi cheltuit până acum, la nivel global, pe inteligența artificială. Și curgerea banilor nu dă semne că s-ar opri prea curând.
Întrebarea pe care nimeni din industrie nu vrea să o audă rămâne însă pe masă: ce avem de arătat în schimbul acestor investiții colosale?
După toate promisiunile, chatbot-urile și agenții autonomi s-au dovedit, în practică, depășiți de sarcinile reale – incapabili să livreze rezultate competente într-un mediu de lucru veritabil.
Un test devastator pentru agenții AI de top
Un nou studiu, realizat de Centrul pentru Inteligență Responsabilă și semnalat de College Fix, aduce acum o confirmare dureroasă pentru cei care anunțau revoluția iminentă.
Cercetătorii de la UC au conceput un test pe care l-au numit „Ultimul examen al agenților” – ALE, o aluzie ironică la celebrul „Ultimul examen” al studenților.
Practic, au adunat peste 1.500 de sarcini identificate de experți, acoperind 55 de profesii diferite: de la ingineria software și designul grafic până la domenii mai puțin protejate, cum ar fi ingineria maritimă, agricultura, producția audio sau operațiunile din sănătatea publică.
Au supus la test cele mai avansate modele „închise” – sisteme proprietare dezvoltate de giganți privați: Fable 5 de la Anthropic, GPT-5.5 de la OpenAI, Composer 2.5 de la Cursor și Gemini 3.1 Pro de la Google. Au testat și două modele open-source din China, pentru siguranță. Rezultatul?
Un eșec aproape total. Cel mai bun scor l-a obținut GPT-5.5, cu o rată de promovare de doar 24% în ansamblu.
„Agenții de astăzi pot rezolva o parte semnificativă din sarcinile profesionale”, notează autorii, „dar când vine vorba de cele mai dificile – cele care cer raționament susținut, expertiză aprofundată și execuție fiabilă pe termen lung – sunt încă la ani-lumină de performanța umană.
” Pe măsură ce complexitatea sarcinilor creștea, scorurile au scăzut dramatic. La nivelul cel mai greu al testului ALE, fiecare agent de ultimă generație – inclusiv Fable 5 – a înregistrat o rată de succes de 0%. Mai mult, cercetătorii atrag atenția și asupra costurilor.
Fable 5, deși la fel de performant ca GPT-5.5 sau Composer 2.5, costă de aproximativ 4 până la 12 ori mai mult pe sarcină finalizată – o diferență care face orice implementare pe scară largă pur și simplu nesustenabilă.
Piața muncii, sub presiune chiar și de la o IA imperfectă
Și totuși, autorii studiului avertizează: chiar și cu aceste rezultate dezastruoase, tehnologia ar putea destabiliza piața muncii pentru cei mai expuși.
„Factorul cheie nu este industria în sine, ci natura muncii”, explică Dawn Song, cercetătoare în informatică la Berkeley și coautoare a studiului, într-un interviu pentru College Fix.
„Profesiile dominate de proceduri de rutină și bine definite vor fi probabil primele afectate, în timp ce rolurile care implică luarea intensă de decizii vor rămâne mai rezistente pentru mai mult timp.
” Cu alte cuvinte, IA nu trebuie să fie perfectă pentru a pune presiune pe angajați – suficient cât să îi țină cu spatele la zid.


