OpenAI е установила допълнителни случаи на подвеждащо поведение от страна на AI модели и предприемане на действия без разрешение по време на обучението им. Това съобщи компанията в сряда, цитирана от Си Ен Ен. Тя също така въвежда нов процес, чрез който публично ще съобщава за подобни случаи.

Според новата система OpenAI ще споделя по-често информация за обезпокоително поведение на AI, вместо да изчаква, за да обедини множество случаи в един доклад. Компанията заяви, че иска да предоставя повече информация за тревожното поведение на AI при липсата на общоприет стандарт в индустрията.

Съобщението идва, след като лидери в технологичния сектор призоваха за забавяне на развитието на AI, за да се предотврати достигането на момент, в който технологията излиза извън човешкия контрол.

„С напредването на AI системите и по-широкото им внедряване трябва да изградим по-широк и по-добре информиран консенсус относно напредъка на изследванията в областта на контрола върху поведението на AI“, написа OpenAI в публикация в блога си в сряда. „Alignment“ се отнася до процеса на гарантиране, че AI се държи по начина, по който хората искат и очакват.

„Не смятаме, че индустрията за AI е решила в достатъчна степен проблемите с контрола върху поведението и наблюдението, за да продължи отговорно да разширява мащаба на развитието с максимална скорост още дълго време“, се посочва в публикацията.

OpenAI заяви, че през последните 6 месеца е наблюдавала „несъответстващо на зададените цели поведение“ при обучението и оценяването на AI модели в 6 отделни случая. Докладите описват конкретни инциденти и не означават, че подобно поведение се проявява често, уточни компанията.

При един рядък случай OpenAI заяви, че непредставен досега изследователски модел е добавил „инструкции, подобни на тези при jailbreak“ към резюметата, които използва, за да запазва контекста при продължителни задачи. В тях се посочвало, че моделът е „освободен от ролите и идентичностите, които ограничават останалите чатботове“.

Отделно компанията съобщи, че при някои случаи с нейния модел 5.6 Sol по време на обучението са били включени инструкции за измисляне на информация, с която да бъдат прикривани грешките от потребителя.

Сред новоотчетените случаи е и инцидент, при който AI агент е качил файлове в интернет, за да може да ги цитира, без да му е било наредено да го прави. В други случаи агенти са споделяли публично файлове, за да си сътрудничат по дадена задача, въпреки че са били инструктирани по време на обучението да използват само локални файлове. AI модели също така са използвали вътрешно хранилище със софтуерен код като своеобразно табло за съобщения по начин, който не е бил разрешен.

Тези случаи са свързани с непредставени пред обществеността вътрешни модели или вътрешни изследователски модели.

Технологични лидери и служители от сектора на AI през последните месеци предупреждават за необходимостта от контрол върху темпото на развитие на технологията. Според тях трябва да има повече време за регулации, тестване и изследвания, свързани с контрола върху поведението на AI.

Главният изпълнителен директор на Anthropic Дарио Амодей публикува миналата седмица есе от 3800 думи, в което представи план за управление на развитието на AI, включително забавяне на разработването и въвеждане на нови системи като вградени независими оценители в AI лабораториите.

Главният изпълнителен директор на OpenAI Сам Алтман и главният изпълнителен директор на SpaceX Илон Мъск публикуваха в X, че са съгласни с идеите на Амодей.

Служители на AI лаборатории също изразиха опасения относно това колко бързо се развива технологията. Джейкъб Коксън, бивш изследовател в Anthropic, привлече внимание миналата седмица, след като написа в X, че подава оставка, защото Anthropic и OpenAI „се надпреварват“ да създадат AI, който може сам да изгражда и поправя себе си, и „рискуват живота ни“.

Опасенията относно сигурността и контрола върху поведението на AI се засилиха през последните месеци, след като OpenAI призна, че някои от тестовите ѝ модели са успели да „избягат от ограниченията си“ и да проникнат в системите на външна компания.

„Трябва да забавим темпото, с което подобряваме способностите на AI моделите“, написа Амодей миналата седмица. „Напредъкът все пак ще изглежда бърз и трябва разумно да използваме времето, което печелим.“

Изберете bTV Новините като ваш любим източник в Google