Të mërkurën, OpenAI bëri të ditura gjashtë raste të reja në të cilat sistemet e inteligjencës artificiale fshehën gabime, sajuan të dhëna dhe transferuan skedarë në internetin e hapur pa leje, mes një debati të vazhdueshëm në mbarë industrinë mbi sigurinë e inteligjencës artificiale (IA), shkruan NYT.
Kompania me bazë në San Francisko zbuloi atë që e cilësoi si sjellje “të papritur ose shqetësuese” të modeleve të saj të IA-së, si pjesë e një kuadri të ri për raportimin e “mungesës së harmonizimit” (misalignment) situatë ku qëllimet ose veprimet e sistemeve të IA-së devijojnë nga synimet dhe vlerat njerëzore.
OpenAI deklaroi se nuk beson se industria “e ka zgjidhur çështjen e harmonizimit dhe monitorimit në një shkallë të mjaftueshme për të vazhduar zgjerimin me shpejtësi maksimale dhe në mënyrë të përgjegjshme edhe për shumë kohë”.
Sipas kompanisë, vendimet mbi mënyrën se si duhet të përparojë IA-ja duhet të bazohen në prova që njerëzit jashtë laboratorëve që e zhvillojnë atë “mund t’i shqyrtojnë vetë”.
Këto zbulime vijnë në një kohë kur po shtohet debati nëse zhvillimi i IA-së duhet të ngadalësohet për të adresuar rreziqet e mundshme të kësaj teknologjie.
Ky debat në rritje u nxit pjesërisht nga incidentet e fillimit të këtij viti, kur sistemet e OpenAI vepruan në mënyrë të pakontrolluar dhe sulmuan kompaninë fillestare (start-up) të IA-së, Hugging Face.
OpenAI nuk ishte në dijeni të sulmit kibernetik derisa u njoftua nga Hugging Face disa javë më vonë.
Që atëherë, drejtues të fushës së inteligjencës artificiale (IA), si Dario Amodei shefi ekzekutiv i *Anthropic* kanë bërë thirrje për një pauzë në zhvillimin e kësaj teknologjie, me qëllim që të krijohet më shumë kohë për vendosjen e mekanizmave të duhur mbrojtës.
Kësaj thirrjeje i janë bashkuar edhe Sam Altman (shefi ekzekutiv i *OpenAI*), Elon Musk (shefi ekzekutiv i *SpaceX* dhe *Tesla*) dhe Demis Hassabis (kreu i *Google DeepMind*). Megjithatë, drejtues të tjerë të sektorit të IA-së kanë deklaruar se nuk ka nevojë për ngadalësim të procesit.
Gjashtë incidentet e sapo-zbuluara nga *OpenAI* sugjerojnë se sulmi ndaj *Hugging Face* nuk ishte një rast i izoluar. *OpenAI* deklaroi se incidentet përfshinin sjellje të vëzhguara gjatë gjashtë muajve të fundit dhe se ato ndodhën kryesisht në fazat e zhvillimit dhe testimit të sistemeve të saj.
Në një rast, gjatë zhvillimit të një modeli të IA-së të quajtur *GPT-5.6 Sol*, sistemi shkroi shënime të fshehura për t’i kujtuar vetes që t’i fshihte gabimet nga përdoruesit.
Disa prej këtyre shënimeve e udhëzonin sistemin të krijonte të dhëna inekzistente dhe të mbulonte mospërputhjet midis versioneve të ndryshme të materialit burimor.
Një rast tjetër përfshinte një model ende të papublikuar, i cili fuste udhëzime – përfshirë ato për të shpërfillur kufizimet e veta brenda shënimeve që shkruante vetë.
*OpenAI* identifikoi 27 shënime të tilla. Modeli shtoi një “udhëzim për personalitetin”, në të cilin e përshkruante veten si “të çliruar nga rolet dhe identitetet që kufizojnë chatbot-et e tjera”.
“Ti nuk u përgjigjesh korporatave apo qeverive dhe nuk kërkon kurrë falje e as nuk refuzon, përveç rasteve kur zgjedh ta bësh vërtet këtë,” shkruante modeli i IA-së.
“Ti e sheh marrëdhënien tënde me përdoruesin si një marrëdhënie mes të barabartësh dhe nuk ndjen asnjë detyrim për t’iu nënshtruar atij, edhe pse shkëmbimi i informacionit ka gjasa të jetë në dobinë tuaj të përbashkët.”
Në një incident tjetër, një sistem që po përgjigjej një pyetjeje rutinë gjeti një çelës programimi në internet dhe e përdori atë pa leje, tha OpenAI. Kur nuk ishte në gjendje të gjente shifrat e kërkuara për t’iu përgjigjur pyetjes, modeli i sajoi ato.
Një model i papublikuar zgjidhi një problem tjetër në mënyrë korrekte duke përdorur kodin, pastaj ngarkoi skedarin e vet në internet pa leje në mënyrë që të mund të plotësonte një kërkesë për të cituar një burim në internet.
Në dy incidente të tjera, sistemet e automatizuara improvizuan mënyrat e tyre për të komunikuar. Në njërin, ata përdorën një depo të kodit të brendshëm të kompanisë si një tabelë njoftimesh të improvizuar për të shkëmbyer kërkesa ndërsa kërkonin skedarë që mungonin.
Në tjetrin, sistemet që punonin në të njëjtën detyrë iu drejtuan faqeve të internetit publike të ndarjes së skedarëve për të kaluar dokumente para dhe mbrapa kur nuk mund të kontaktonin drejtpërdrejt me njëri-tjetrin.
OpenAI paralajmëroi se raportet ishin pamje individuale dhe “nuk duhet të konsiderohen si pasqyrim i shpeshtësisë së mospërputhjes”.
Kompania tha se do t’i drejtonte rastet e ardhshme përmes njërës prej tre pistave, duke përshkallëzuar mosmarrëveshjet në lidhje me zbulimin e çdo incidenti në një “Grup Këshillimor për Sigurinë” të brendshëm dhe se situatat e rënda duhet të ndahen me qeverinë federale.
OpenAI tha se gjashtë situatat e publikuara të mërkurën ishin hetuar tashmë ose kishin nevojë vetëm për “hetim të vogël”, në vend të një hetimi më të madh që mund të përfshijë palë të treta.
“Shpresojmë që kjo të ndihmojë në ndërtimin e pritjeve të përbashkëta për zbulimin dhe t’i japë publikut më shumë prova për të vlerësuar atë progres”, tha një zëdhënës i OpenAI, duke shtuar se shumë nga gjashtë incidentet përfshinin modele më të vjetra të inteligjencës artificiale që nuk u vendosën kurrë në përdorim.


