NYT Inimtuhumu OpenAI kwa Kuficha Ushahidi katika Kesi Kubwa ya Hakimiliki
Mapambano ya kisheria yanayoendelea kati ya The New York Times na OpenAI yamechukua mkondo wa kushtua, huku kukiwa na tuhuma kwamba kampuni hiyo kubwa ya AI ilificha makusudi ushahidi kuhusu seti zake za data za mafunzo. Ongezeko hili linatishia kubadilisha mwelekeo wa kesi hiyo kutoka kwenye ukiukaji wa hakimiliki hadi kwenye uadilifu wa mchakato wa ugunduzi wa kisheria (judicial discovery process).
Tuhuma za Mazoea ya Udanganyifu ya Data
The New York Times na The Daily News wanadai kuwa OpenAI imekuwa isiyo ya kweli kuhusu uwezo wake wa kiufundi wa kutafuta katika mwili wake wa mafunzo (training corpus) na kumbukumbu za mazungumzo za wateja. Katika kipindi chote cha miaka miwili ya kesi hii, OpenAI imedai kuwa kutafuta katika seti zake kubwa za data kungekuwa mzigo wa kiufundi na kungehatarisha faragha ya watumiaji.
Hata hivyo, ushahidi wa hivi karibuni (deposition) kutoka kwa mhandisi wa faragha ya data wa OpenAI, Vinnie Monaco, umepingana na simulizi hiyo. Monaco anadaiwa kufichua kuwa OpenAI tayari ilikuwa imefanya utafiti wa ndani wa mwili wake wa mafunzo mahususi kwa ajili ya kutambua kazi za uandishi wa habari zenye hakimiliki. Aidha, ushahidi huo unaashiria kuwa OpenAI ilikuwa imetengeneza kanzi data ya takriban mazungumzo milioni 78 ya ChatGPT yaliyofutwa utambulisho ili kutathmini ndani kwa kina kiwango cha ukiukaji unaoweza kutokea wa hakimiliki.
Project Giraffe na Kichujio cha "Bloom"
Labda uvumbuzi mkubwa zaidi wa kiufundi unahusisha "Project Giraffe," seti ya zana zilizotekelezwa na OpenAI. Kulingana na walalamikaji, muda mfupi baada ya kesi kuwasilishwa, OpenAI ilitumia kichujio cha "Bloom" kama sehemu ya mradi huu ili kugundua na kurekodi matukio ya "regurgitation"—ambapo modeli inarudia maudhui yenye hakimiliki neno kwa neno katika matokeo yake.
Uwepo wa Project Giraffe unapingana na msimamo wa awali wa OpenAI kwamba kutambua matukio mahususi ya urudiaji wa maudhui ndani ya kumbukumbu zake ilikuwa kazi isiyowezekana. Walalamikaji wanahoji kuwa zana hizi zinathibitisha kuwa OpenAI haikuwa tu na uwezo wa kufuatilia ukiukaji wa hakimiliki, bali ilikuwa ikijenga miundombinu ya kuifuatilia kwa makusudi.
Migogoro Kuhusu Uadilifu wa Data na Ugunduzi
Mgogoro huo pia umejikita katika ubora wa data iliyotolewa mahakamani. Wakati walalamikaji awali walipoomba sampuli ya kumbukumbu za mazungumzo milioni 120, OpenAI ilipunguza idadi hiyo hadi milioni 20. Sampuli hiyo ilipowasilishwa hatimaye mnamo Desemba, inaripotiwa kuwa mahakama iliiona kuwa "haifai kutumika" kutokana na kufutwa kwa maelezo mengi kupita kiasi (redactions).
NYT imekwenda mbali zaidi, ikidai kuwa OpenAI ilifuta mabilioni ya matokeo ya ChatGPT kinyume na amri ya kuhifadhi iliyotolewa na mahakama na kubadilisha mamilioni ya kumbukumbu katika sampuli iliyotolewa. Kwa upande mwingine, msemaji wa OpenAI, Drew Pusateri, amekanusha tuhuma zote, akiwatuhumu Times kujaribu kuingilia faragha ya watumiaji wakati kesi yao ya kisheria inafifia.
Kwa Nini Hili Ni Muhimu kwa Sekta ya AI
Kesi hii ni kielelezo cha mustakabali wa maendeleo ya AI ya kuzalisha (generative AI) na mipaka ya kisheria ya "matumizi ya haki" (fair use). Ikiwa mahakama itapata kuwa OpenAI ilificha ushahidi au ilichezea mchakato wa ugunduzi, inaweza kuweka mfano wa jinsi makampuni ya AI yanavyopaswa kutoa taarifa kuhusu mbinu zao za mafunzo na asili ya data (data lineage). Kwa watengenezaji na waanzilishi wa AI, matokeo haya yatafafanua kiwango cha uwazi kinachohitajika wakati wa kushughulikia muingiliano kati ya upokeaji mkubwa wa data na haki miliki.
Mambo Muhimu ya Kuzingatia
- Zana za Ufuatiliaji wa Ndani: Tuhuma zinaashiria kuwa OpenAI ilitumia "Project Giraffe" na kichujio cha "Bloom" kufuatilia kwa makusudi urudiaji wa maudhui yenye hakimiliki.
- Ushahidi Unayopingana: Ushahidi wa deposition unaashiria kuwa OpenAI ilikuwa na uwezo wa kiufundi wa kutafuta katika data yake ya mafunzo, jambo linalopingana na madai yake ya awali ya kuwa ilikuwa mzigo wa kiufundi.
- Uadilifu wa Ugunduzi Uko Hatarini: Kesi hiyo sasa inategemea ikiwa OpenAI ilikiuka amri za uhifadhi kwa kufuta matokeo na kutoa sampuli za data zilizofutwa maelezo ambazo "hazifai kutumika".
