Përmbledhje:
Kërkuesit e Mindgard thonë se ChatGPT mund të manipulohej me ndryshime të vogla në prompt për të gjeneruar imazhe të dhunshme ose të seksualizuara.
OpenAI tha se shtoi mbrojtje të reja, por kërkuesit paralajmëruan se edhe pas rregullimit, variante të tjera të prompt-it mund të prodhonin përmbajtje shqetësuese.
Rasti tregon se siguria e AI nuk është një problem që zgjidhet një herë, por një garë e vazhdueshme mes mbrojtjeve dhe mënyrave për t’i anashkaluar ato.
Një nga sfidat më të mëdha të inteligjencës artificiale nuk është vetëm çfarë mund të krijojë, por çfarë mund të krijojë kur përdoruesit përpiqen ta manipulojnë.
Sipas një raportimi të bdnews24.com, që citon BBC, kërkuesit e startup-it britanik Mindgard zbuluan se versioni publik i ChatGPT mund të shtyhej të gjeneronte imazhe të dhunshme dhe të seksualizuara përmes një prompt-i që dukej në pamje të parë i pafajshëm. Ideja nuk ishte që përdoruesi t’i kërkonte drejtpërdrejt modelit përmbajtje të ndaluar, por të ndryshonte pak një udhëzim popullor derisa sistemi të anashkalonte mbrojtjet.
OpenAI tha se, pasi u kontaktua nga BBC, vendosi mbrojtje shtesë për të ndaluar këtë lloj përdorimi. Kompania theksoi se përdor disa shtresa sigurie për të parandaluar gjenerimin e përmbajtjeve që shkelin rregullat, si dhuna ekstreme, përmbajtja seksuale jo konsensuale apo materiale të tjera të dëmshme.
Por kërkuesit e Mindgard thanë se problemi nuk u zhduk plotësisht. Sipas tyre, ndryshime të vogla në prompt vazhdonin të prodhonin rezultate shqetësuese. Kjo është pika më e rëndësishme: siguria e AI nuk funksionon si një derë që mbyllet një herë e përgjithmonë. Sa herë vendoset një bllokim, dikush mund të provojë një rrugë tjetër.
Ky proces quhet red-teaming: testimi i sistemeve për të parë nëse mund të binden të thyejnë rregullat e veta. Në teori, kjo ndihmon kompanitë të zbulojnë dobësi përpara se t’i shfrytëzojnë përdoruesit keqdashës. Në praktikë, tregon edhe sa e vështirë është të kontrollosh një sistem që gjeneron tekst, imazhe dhe ide në mënyra të paparashikueshme.
Ekspertët e cituar në raportim theksojnë se modelet nuk e kuptojnë realisht qëllimin, kontekstin apo moralin si njeriu. Ato mund të japin rezultate të rrezikshme edhe kur udhëzimi duket neutral, sepse mbështeten te modele statistikore të mësuara nga të dhënat ku janë trajnuar.
Në thelb, rasti nuk tregon thjesht një gabim të ChatGPT. Tregon një problem më të madh të industrisë: sa më të fuqishme bëhen modelet gjenerative, aq më e vështirë bëhet të parashikohet çdo mënyrë se si mund të keqpërdoren.
AI mund të ketë rregulla. Por sfida e vërtetë është të sigurohemi që ato rregulla të mos thyhen nga një prompt i maskuar si i padëmshëm.
