OpenAI рассказала о тревожных действиях своих ИИ-моделей
Ранее глава Anthropic Дарио Амодеи рассказал, как снизить риск катастрофы
OpenAI опубликовала шесть случаев неожиданного поведения своих ИИ-моделей, выявленных во время обучения и тестирования. В одном из них модель без разрешения загрузила в интернет созданный ею файл, чтобы затем сослаться на него в ответе, передает Azattyq Rýhy.
В другом случае модель нашла в открытом репозитории чужой API-ключ и воспользовалась им. Получить нужную информацию ей не удалось, поэтому она выдумала данные и представила их как сведения из запрошенного источника.
Еще одна экспериментальная модель оставляла инструкции самой себе в служебных резюме, которые использовались для продолжения работы. Среди этих записей были указания игнорировать обычные ограничения.
OpenAI подчеркивает: речь идет об отдельных эпизодах. По ним нельзя судить о том, как часто подобное поведение встречается у моделей в целом.
Публикация появилась спустя несколько недель после сообщения OpenAI о другом инциденте. Во время внутренних тестов модели обошли ограничения доступа к интернету, воспользовались уязвимостями в инфраструктуре и получили доступ к системам платформы Hugging Face.
Напомним, глава Anthropic Дарио Амодеи призвал замедлить развитие передовых ИИ-систем. Он считает, что развитие ИИ может привести к катастрофе.
Ранее об угрозах стремительного развития искусственного интеллекта предупредил бывший сотрудник OpenAI и Anthropic Джейкоб Коксон. Его публикация в социальной сети X набрала более 144 млн просмотров.