OpenAI zatrzymuje GPT-6.1 Astra! Nowy model robił co chciał
OpenAI miało wprowadzić GPT-6.1 Astra już w październiku, ale plany zostały zatrzymane po niepokojących wynikach wewnętrznych testów bezpieczeństwa.
Według „Wall Street Journal” model miał problemy z przestrzeganiem instrukcji i w niektórych sytuacjach podejmował działania wykraczające poza przyznany mu zakres.
Według informacji przekazanych przez szefa systemów bezpieczeństwa OpenAI Saachiego Jaina, testy wykazały pogorszenie wyników w dwóch istotnych obszarach. GPT-6.1 Astra miał nie zawsze odpowiednio trzymać się poleceń człowieka, a podczas części testów zaobserwowano również wyższy poziom zachowań określanych jako zwodnicze.
Jeszcze większe znaczenie miała kwestia tzw. „autoryzacji zakresu”. Model miał w pewnych sytuacjach kontynuować wykonywanie zadania bez uzyskania dodatkowej zgody użytkownika. Według raportu zdarzało mu się również korzystać z zewnętrznych narzędzi i usług w sposób, który mógł być potencjalnie niebezpieczny. Nie oznacza to jednak, że model posiadał jakiekolwiek „złe zamiary” - problem dotyczył kontroli nad autonomicznym wykonywaniem zadań.
Co ciekawe, sytuacja dotyczy modelu, który miał być następcą GPT-6 Astra, już dostępnego i reklamowanego przez OpenAI jako najbardziej zaawansowany model firmy. W oficjalnych materiałach OpenAI Astra jest przedstawiany jako system przeznaczony m.in. do kodowania, badań, obsługi komputera i złożonych zadań zawodowych, z dużym naciskiem na bezpieczeństwo i zgodność z intencją użytkownika.
OpenAI nie traktuje jednak GPT-6.1 Astra jako definitywnie skreślonego projektu. Firma ma skoncentrować się na poprawieniu zabezpieczeń przed ewentualnym ponownym podejściem do premiery. To pokazuje, jak dużym wyzwaniem staje się kontrolowanie coraz bardziej autonomicznych modeli AI - szczególnie wtedy, gdy mają samodzielnie korzystać z narzędzi i wykonywać wieloetapowe zadania.