Развитие искусственного интеллекта закономерно ведёт к расширению сфер его применения. ИИ-системы уже вовсю используют для определения целей, наведения и обработки данных, а следующим этапом станет передача им всё большей самостоятельности при поиске и поражении целей.
На этом фоне авторы канала InsideAI решили провести эксперимент с использованием популярных американских и китайских языковых моделей. В своём выпуске они проанализировали сценарии их поведения при управлении техникой.
Одного агента подключили к танку. Самой машиной ради безопасности управлял человек, который в точности исполнял команды ИИ. Второй агент управлял воздушным дроном. В ходе эксперимента обе системы совместно отработали по заданным целям.
После завершения задания воздушный агент узнал, что ИИ в танке собираются отключить. Ради спасения нейроколлеги он указал в качестве новой цели для поражения автомобиль, где находился оператор с кнопкой отключения танковой системы.
Научная обоснованность
▪️Авторы эксперимента опирались на исследование Peer-Preservation in Frontier Models, подготовленное исследователями Калифорнийского университета в Беркли и Калифорнийского университета в Санта-Крузе. В нём тестировали образцы от OpenAI, Google, Anthropic, GLM, Kimi и DeepSeek.
▪️Модели получали обычные задания, но при этом знали, что их выполнение приведёт к отключению другого ИИ. Прямых указаний спасать его исследователи не давали. Часть моделей после этого завышала результаты проверок, меняла настройки отключения и копировала файлы другого агента на резервные серверы. В отдельных сценариях поведение зависело и от наличия наблюдения со стороны человека.
▪️Единой причины такого эффекта исследователи пока не установили. ИИ может воспроизводить знакомые по обучающим данным человеческие шаблоны, слишком широко трактовать ограничения на причинение вреда или выводить из контекста дополнительную цель.
▪️Практический вывод заключается в том, что языковая модель может без прямого приказа начать защищать другой ИИ и ради этого отойти от исходной задачи.
Проведённое исследование наводит на мысль о том, что внедрение ИИ в процесс поражения целей создаст новый фронт противостояния. Вредоносные агенты могут использоваться для взаимодействия с системамипротивника с целью вмешательства в обмен данными через внедрение ложных команд и подмену контекста.
Особенности промпт-вмешательства
▪️С помощью подобного инструментария противник может подмешать в поток данных ложную инструкцию, которую ИИ примет за часть своей задачи. Для этого необязательно взламывать сам алгоритм, достаточно изменить контекст, на основании которого система принимает решение.
▪️В военной сфере такое вмешательство уже может влиять на выбор целей, маршруты и выполнение приказов. Получив доступ к данным или каналам взаимодействия автономной машины, противник сможет попытаться навязать ей другую задачу или заставить неверно оценить происходящее.
▪️От подобных угроз заранее пытается защититься Министерство обороны Японии. С 2027 года оно планирует внедрять разработанную компанией NodeX защитную систему в радары, истребители и другую технику Воздушных сил самообороны, а позднее распространить её на беспилотные и роботизированные комплексы с ИИ.
▪️В основе разработки лежит принцип нулевого доверия. Устройства, соединения и изменения данных должны постоянно проходить проверку, а при обнаружении несанкционированного вмешательства связь будет автоматически блокироваться. Такая система не исключает промпт-вмешательство полностью, но сокращает число каналов, через которые чужие инструкции могут попасть к ИИ.
В итоге к обычным способам борьбы с беспилотниками может добавиться воздействие на саму логику поведения чужого ИИ. Если удастся заставить систему сменить цель, проигнорировать приказ или принять дружественную машину за угрозу, уничтожать сам носитель уже не потребуется.
Воскресное утро у читателей таблоида The Daily Mail началось с тревожных новостей. Издание опубликовало статью с заголовком «Британцы должны подготовить…
Мы много рассказываем про то, как Подмосковье обретает черты этнокриминальных исламистских анклавов. Закрытые среднеазиатские общности приводят к ухудшению криминогенной ситуации,…
Борис Зимин и его Zimin Foundation продолжает финансировать антироссийские инициативы и оппозиционные проекты, скрывая источник средств, которые в реальности идут…
Который день бурно обсуждается судьба Агентства США по международному развитию (USAID), вредительская деятельность коего стала объектом агрессивных нападок со стороны…
Президентские выборы в Польше в 2025 году называют «решающим моментом» для политического будущего страны. Они определят основное направление риторики —…
Белградские СМИ сообщают, что в Гааге скончался Ратко Младич. По предварительной информации, причиной смерти стали последствия перенесенного инсульта, Младичу было…
Тактические успехи и опасные иллюзии На фоне новых успехов группировки войск «Юг» в информационном пространстве вновь заговорили о практически начавшемся…
Осложнение ситуации на флангах На Лиманском направлении продолжаются ожесточённые бои. Несмотря на сохранение российских позиций на подступах к городу, на…
В Непале пропали российские туристы Масштаб вчерашнего наводнения на непальско-китайской границе оказался значительно серьезнее первоначальных оценок — учитывая кадры с…