Ovaj AI za igranje je novi prvak u Strategu

  • Objavljeno u Znanost
image

Novi AI sustav koji se ističe u izazovnim igrama sa skrivenim informacijama mogao bi jednog dana pomoći donositeljima odluka u odabiru idealnih strategija za nadmudrivanje protivnika u kompliciranim situacijama poput vojnih manevara. 

Koristeći napredak u strojnom učenju, istraživači s MIT-a, Sveučilišta Carnegie Mellon, Sveučilišta New York i Sveučilišta Stanford razvili su umjetnu inteligenciju koja je s velikom razlikom pobijedila najbolje rangirane ljudske igrače društvene ratne igre Stratego, nešto što nijedan sustav umjetne inteligencije nije uspio postići. 

Stratego, igra za dva igrača s nesavršenim informacijama, u kojoj identiteti protivničkih figura ostaju skriveni, često se koristi kao mjerilo za testiranje sposobnosti strateškog razmišljanja moćnih AI modela. 

Kako bi izgradili svoj model, istraživači su kombinirali učinkovite algoritme za obuku s novim tehnikama prilagođenim za izračunato donošenje odluka u okruženjima skrivenih informacija. 

AI sustav postigao je bolje performanse u Strategu od sljedećih najboljih modela, a istovremeno je bio daleko jeftiniji i računalno manje zahtjevan za obuku. Sustav je također nadmašio vrhunske ljudske igrače u drugim strateškim igrama s različitim pravilima i dizajnom, pokazujući kako se može generalizirati za različite slučajeve upotrebe. 

Sustav umjetne inteligencije mogao bi se prilagoditi kako bi pomogao ljudima u rješavanju mnogih stvarnih problema sa skrivenim informacijama, poput poslovnih pregovora ili kibernetičke sigurnosti. 

Svijet je pun problema s nesavršenim informacijama. U tim interakcijama neke strane posjeduju informacije koje druge nemaju. Na primjer, trgovci na financijskim tržištima možda ne znaju obrazloženje iza trgovina drugih, dok vojne snage vjerojatno nemaju potpuno znanje o neprijateljskim položajima.

Kod skrivenih informacija, odluke koje stranke donose, kao i odluke koje odluče ne donijeti, isprepletene su na takav način da je izuzetno teško odrediti najbolje korake koje treba poduzeti. 

Stratego se često koristi za modeliranje situacija s nesavršenim informacijama. U ovoj ratnoj igri na ploči, koja nalikuje vojnom šahu, igrači slažu 40 figura na svoju stranu ploče, a zatim pomiču figure po ploči kako bi osvojili protivničku zastavu. 

Istraživači s MIT-a krenuli su u razvoj potpunog sustava umjetne inteligencije koji bi mogao postići nadljudske performanse uz manje troškove, a nazvali su ga Ataraxos (grčka riječ koja se koristi za opisivanje nekoga tko je bezbrižan ili oslobođen tjeskobe). 

Kako bi izgradili Ataraxos, istraživači su trenirali model koristeći tehniku ​​koja se naziva "učenje s potkrepljenjem samostalne igre". Model se mnogo puta natjecao sam protiv sebe kako bi naučio snažan „nacrt strategije“ o tome kako se izvrsno snaći u Strategu. 

Osmislili su posebno učinkovite algoritme koji su omogućili Ataraxosu da uči puno brže od prethodnih metoda, a istovremeno su osigurali da se ne zaglavi pokušavajući predvidjeti svaki mogući potez. To smanjuje troškove obuke i poboljšava performanse. 

Tijekom igre, Ataraxos koristi strategiju nacrta kao početnu točku za postavljanje ploče i početak razmišljanja o svojim sljedećim potezima u svakom krugu igre. 

Ali prije nego što djeluje, usavršava svoje izbore u hodu koristeći tehniku ​​koja se naziva planiranje vremena odlučivanja. Sustav koristi generativni model koji koristi vjerojatnosti za procjenu vjerojatnih identiteta skrivenih figura protivnika, a zatim procjenjuje buduće izbore prije odabira sljedećeg poteza. 

Inovativna upotreba ovog generativnog modela za planiranje vremena donošenja odluka bila je nedostajući dio koji je omogućio Ataraxosu postizanje nadljudskih performansi. 

Ataraxos je pobijedio najjačeg Stratego igrača na svijetu rekordnom razlikom od 15-1-4 i postigao omjer 39-2 protiv najboljih ljudskih igrača na Stratego svjetskom prvenstvu. 

Istraživači su također prilagodili Ataraxos za druge igre s nesavršenim informacijama, uključujući Barrage Stratego (brža varijanta s manje figura), Hanabi (kooperativna kartaška igra s mnogo igrača) i Dou dizhu (igra u kojoj dva igrača surađuju protiv trećeg), a sustav je u svakom slučaju postigao nadljudske performanse. 

U budućnosti, istraživači žele u Ataraxos ugraditi mjere interpretabilnosti kako bi sustav mogao objasniti svoje donošenje odluka na način koji čovjek može razumjeti.

Istraživački rad znanstvenika MIT-a objavljen u časopisu Nature možete pronaći na ovoj poveznici.

Podijeli