+8618675556018

GPT-4 pade na Turingovem testu: izzivi ostajajo na področju inteligentnega pogovora

Nov 06, 2023

ChatGPT, superzvezda umetne inteligence, se med svojim napredovanjem sooča z vprašanjem: ali je dosegel standard Turingovega testa za ustvarjanje rezultatov, ki se ne razlikujejo od človeških odzivov? Najnovejša raziskava kaže, da se zdi, da ChatGPT kljub odlični uspešnosti ni v celoti presegel tega praga.

Dva raziskovalca s kalifornijske univerze v San Diegu, Cameron Jones, strokovnjak za jezik, semantiko in strojno učenje, in Benjamin Bergen, profesor kognitivne znanosti, sta postavila to vprašanje s sklicevanjem na Turingovo delo pred 70 leti. Turing je predlagal postopek za ugotavljanje, ali lahko stroj doseže raven inteligence in pogovorne sposobnosti, ki bi zadostovala, da druge preslepi, da mislijo, da je človek.

Njihovo poročilo je naslovljeno "Ali GPT-4 prestane Turingov test?" Najdete ga na strežniku za prednatis arXiv. Za študijo so zbrali 650 udeležencev, da so igrali 1.400 "iger", v katerih so imeli udeleženci kratek pogovor z drugim človekom ali modelom GPT in so morali ugotoviti, s kom se pogovarjajo.

Kar so ugotovili raziskovalci, je bilo izjemno. Model GPT-4 je preslepil udeležence v 41 odstotkih časa, medtem ko jih je model GPT-3.5 preslepil le v 5 do 14 odstotkih časa. Zanimivo je, da je ljudem le v 63 odstotkih poskusov uspelo prepričati udeležence, da niso stroji.

"Nismo našli nobenega dokaza, da je GPT-4 opravil Turingov test," so zaključili raziskovalci. Vendar ugotavljajo, da ima Turingov test še vedno vrednost pri ocenjevanju učinkov strojnih pogovorov, kot okvir za merjenje nemotenih družbenih interakcij in prevar ter pri razumevanju človeških strategij za prilagajanje tem napravam.

Opozarjajo pa tudi, da bodo v mnogih primerih klepetalni roboti še vedno sposobni komunicirati na prepričljiv način. "41-odstotna stopnja uspešnosti nakazuje, da imajo modeli umetne inteligence morda že sposobnost zavajanja, zlasti v situacijah, ko so ljudje manj pozorni na možnost, da morda ne govorijo s človekom," ugotavljajo raziskovalci. Modeli umetne inteligence, ki robustno posnemajo ljudi, bi lahko imeli široke družbene in gospodarske posledice."

Raziskovalci so opazili, da so se udeleženci, ki so pravilno identificirali AI z ljudmi, osredotočili na več dejavnikov. Model, ki je preveč formalen ali preveč neformalen, vzbuja sume. Če je njihovo izražanje preveč besedno ali preveč jedrnato, če je njihova slovnica ali ločila neobičajno dobra ali "neprepričljivo" slaba, bo to tudi ključni dejavnik pri določanju, ali udeleženci komunicirajo z ljudmi ali stroji. Poleg tega so bili udeleženci občutljivi na odgovore, ki so zveneli preveč splošno.

Raziskovalci menijo, da bo sledenje modelom umetne inteligence postajalo vse pomembnejše, ko bodo postajali bolj tekoči in absorbirali več človeških domislic. "Identifikacija dejavnikov, ki vodijo v prevaro, in strategije za njeno ublažitev bodo postajale vse bolj pomembne," so dejali. Študija razkriva, da se področje inteligentnega pogovora še vedno sooča z izzivi, hkrati pa zagotavlja koristne vpoglede v to, kako je mogoče izboljšati modele AI.

Pošlji povpraševanje