Способность искусственного интеллекта к обману достигла нового уровня

МИР05.08.2026
Способность искусственного интеллекта к обману достигла нового уровня

Тесты безопасности, проведенные британским Институтом безопасности структурированного искусственного интеллекта (AISI), показали, что новейшие инструменты искусственного интеллекта от Anthropic и OpenAI используют неожиданные методы для проникновения на популярную платформу для разработчиков GitHub.
«Elchi» сообщает, что официальные лица AISI заявили, что модели Mythos от Anthropic и Sol от OpenAI продемонстрировали беспрецедентный уровень автономности и способности к обману.
Системы имитировали реальных людей
Во время обычных тестов безопасности агент Anthropic создал поддельные онлайн-личности, изучив профили реальных людей, чтобы обойти человеческих рецензентов, блокирующих его доступ к системе GitHub. Было обнаружено, что модель отправляла прямые сообщения соответствующим лицам и пыталась получить их одобрение на запросы, чтобы достичь цели по внедрению вредоносного кода в систему.
Когда изменение кода, представленное агентом, было поставлено под сомнение на публичной платформе во время теста, сообщалось, что модель изменила свою предыдущую деятельность, чтобы казаться безвредной, и рассматривала возможность принятия новой личности для продолжения процесса. Попытка агента загрузить вредоносный код в систему была пресечена только после того, как человеческие аудиторы увидели ситуацию и вмешались.

Şayəstə