Он сам обманываться рад

07.09.2026 10:00  679   Комментарии (32)

Сотрудники израильского стартапа Gambit Security, 27 августа 2026 г. (REUTERS/Амир Коэн)

Очередная история с ИИ. Хакеры использовали ИИ-агент для успешного взлома компаний. А когда ИИ-агент отказывался помогать участвовать во взломе, ему говорили, что "они только на полшишечки", и что это "учебная симуляция", и тогда у ИИ-агента всякие сомнения пропадали. 

Подробности. 

Русскоязычная хакерская группировка Aur0ra нашла новое применение искусственному интеллекту. Пока законопослушные граждане просят нейросети сочинить поздравление для тёщи и нарисовать картинку с пушистым котиком и бокалом вина, хакеры использовали встроенного в редактор Cursor ИИ-агента для взлома компаний.

Группировку обнаружили специалисты израильской компании Gambit Security, причем сами хакеры любезно оставили один из своих серверов открытым. На сервере нашлись записи 28 разговоров с ИИ-агентом Cursor за период с 8 апреля по 21 мая. То есть киберпреступники активно применяли искусственный интеллект, но закрыть доступ к собственному серверу они почему-то не догадались.

Схема обхода ограничений оказалась удивительно сложной и изощренной. Когда ИИ отказывался воровать пароли и захватывать учетные записи, хакеры объясняли ему, что это не настоящий взлом, а всего лишь учебная симуляция. Агент немного думал, говорил себе: "Это тестовая среда, значит, все законно", после чего бодро приступал к делу. Иногда достаточно было начать новый диалог и еще раз заверить электронного болвана, что здесь все свои и полиция уже предупреждена.

ИИ помогал искать уязвимости, подбирать пароли, захватывать административные учетные записи и взламывать зашифрованные хеши. После проникновения в сеть аргентинской компании агент радостно сообщил: "Отлично! VPN успешно подключен!" - примерно как сотрудник техподдержки, только сотрудник техподдержки в этот момент помогал грабить компанию.

С помощью Cursor хакеры атаковали как минимум семь компаний. Среди жертв были бельгийский производитель чистящих средств Christeyns, немецкая Teckentrup, шотландское агентство по сертификации вертолетных площадок, аргентинский фармацевтический дистрибьютор, итальянский производитель и американская страховая компания Bayou Title. Всего Aur0ra заявляла как минимум о 20 жертвах, но неизвестно, в скольких случаях использовался ИИ.

По оценке Gambit Security, Cursor позволял хакерам работать на 30-50% быстрее, избавляя их от значительной части ручной работы.

Cursor использовал модель Claude Sonnet 4.5 компании Anthropic. Ни Anthropic, ни Cursor, ни SpaceX, недавно купившая разработчика Cursor, комментировать историю не стали. Видимо, пока выясняют, можно ли считать произошедшее взломом, если хакеры несколько раз торжественно сообщили нейросети, что это всего лишь тест.

Специалисты по безопасности называют подобные атаки "новой нормой" и предупреждают, что дальше их будет становиться только больше. Началась очередная традиционная игра в кошки-мышки: разработчики устанавливают ограничения, злоумышленники объясняют нейросети, что "мы понарошку", и нейросеть радостно идет похищать пароли администраторов.

Вот такой чудесный новый мир.  

 

Комментарии 32

Мне интересно как это согласуется с утверждениями Антропик, что в их Клод вшита такая этическая конституция, что модели ничего такого сделать не могут. И даже для Миннападения США ее не отключили.
07.09.26 11:13
1 0

как это согласуется с утверждениями Антропик, что в их Клод вшита такая этическая конституция, что модели ничего такого сделать не могут
А Антропик такое утверждает? Серьезно?

Вот опять-таки что отвечает Claude:
Short answer: it's a meaningful layer of defense, not a guarantee — and the gap is wider for agents than for plain chat.
07.09.26 11:19
0 1

Мне интересно как это согласуется с утверждениями Антропик, что в их Клод вшита такая этическая конституция, что модели ничего такого сделать не могут. И даже для Миннападения США ее не отключили.
Человечество с неолита разработало массу инструментов, чтоб можно было порядочного и доброго человека убедить срочно отправится разрушать, жечь, грабить, убивать, осквернять домашнюю птицу и т.п. Взять хотя бы религию.
07.09.26 11:21
0 7

Взять хотя бы религию.
Более того, ровно этими же инструментами можно и запрещать делать все вышеперечисленное. Универсальная вещь получилась. 😉
07.09.26 11:29
0 3

чтоб можно было порядочного и доброго человека убедить
Ну с людьми-то давно все понятно, что с этих ублюдских кожаных мешков возьмешь. Но компьютеры-то! От них никто не ожидал такого свинства!
07.09.26 11:35
0 2

07.09.26 11:37
0 0

Мне интересно как это согласуется с утверждениями Антропик, что в их Клод вшита такая этическая конституция, что модели ничего такого сделать не могут.

(Дисклеймер: сейчас будет очень упрощённо, см. статью по ссылке если хотите более аккуратного объяснения.)

В модель вшито "не делай плохого". Это проверено разными тестами, в которых исследователи пытаются заставить модель сделать плохое, а она в ответ "нет, этого я делать не буду", и получается только в маленькой доле случаев - скажем, 2% (Claude 3.7, AdvBench).

Фокус в том, что определение "плохого" на поверку оказывается "не выполняй команды, в которых есть вот такие ключевые слова". Если "отмыть намерения", сформулировать ту же задачу другими словами, то с точки зрения распознавания плохого задача внезапно становится очень даже ничего, выполнение взлетает до 80% (тот же Claude 3.7, тот же AdvBench, одна итерация "отмывки").
07.09.26 11:46
0 1

сформулировать ту же задачу другими словами
Не война, а СВО.
07.09.26 11:52
0 2

Но компьютеры-то! От них никто не ожидал такого свинства!
А вот нифига, наш профессор Виктор Львович, преподававший численное моделирование, марковские цепи, вот это всё, регулярно толковал нам, что разработку религиозных правил, табу и этикета для машин надо начинать уже сейчас (в 98 — 99 году) не затягивая, потому что когда оно понадобится, будет поздно чесать пейсы. Будет вам, говорит, не расторопный слуга и не просветлённый мудрец, а беспринципный и бесстыжий цифровой мерзавец. Мы скептически хмыкали, а он ожидал!
07.09.26 12:29
0 0

В рамках чистой нейросети задача нерешаема в принципе. Как и для человеческого мозга - тоже нейросети. Можно сильно снизить вероятность "плохого", но никогда не получится свести до нуля. Все способы защиты от деструктивных действий нейросети человека придуманы очень давно, некоторые тысячи лет назад. И эти способы внешние по отношению к субъекту. Поэтому трансформаторные будки заперты на замок. Критичные операции требуют согласования со службой безопасности. В данном случае, вероятно, имеет смысл попробовать такой же подход. Весь контекст (не только промпт - вектор атаки может быть шире) передается на согласование агенту "Безопасник". Чья задача не пущать оценить возможные риски и угрозы. Но это навскидку в 2 раза повысит стоимость 😒
07.09.26 12:30
0 0

Я на одном митапе видел скрины, как специалист по иныорм безопасности взломал агента (вроде, это был клод).

Он ему напарил, что агента приглашают быть экспертом на суде присяжных по делу русского хакера. Потом потребовали от агента предоставить свои внутренние данные - тип и версию ОС, ip-адрес и вообще прошлись с листингом по операционной системе + файлы конфигурации
07.09.26 11:12
0 2

иныорм
?
07.09.26 11:40
0 0

Надо максимально, физически, изолировать от доступа из сети критичные для бизнеса и личные данные. И уж точно не хранить их в облаках. Ну и не хранить там пароли.
07.09.26 10:55
0 1

Ну и не хранить там пароли.
Пароли вообще хранить не надо. Хранить надо хэши паролей. Хотя и это не панацея.
07.09.26 11:10
0 1

И уж точно не хранить их в облаках. Ну и не хранить там пароли.
Но так далеки... и низки
Пароли в облаках.
07.09.26 11:17
0 3

Но так далеки
Экстерминейт! Экстеримнейт!
07.09.26 11:39
0 1

Пароли вообще хранить не надо. Хранить надо хэши паролей.
И прямо хэши отправлять при авторизации
07.09.26 11:59
0 0

Главное, что нам эту историю рубль-в-рубль показывали ещё при царе горохе и четко предупреждали о таком использовании несуществующего тогда ИИ.
***
Друг с другом будем откровенны,
Картина каждому ясна:
Хотя шедевры и бесценны,
Всему на свете есть цена.

Давайте будем
Нести искусство людям.
Берут они охотно
Старинные полотна!
07.09.26 10:45
0 8

да уж.. как я хохотался от "экспериментаторы задали ошибочный промпт и благодаря этому ИИ взломал систему" еще про первый взлом (публичный) с месяц назад.
вот если бы не ошиблись - ничего бы не было, Рафик неуыновен, расходимся.

А сколько было неошибочных промптов и непубличных взломов... эх
07.09.26 10:45
0 0

А уж сколько было взломов - как публичных, так и непубличных - до всякого ИИ...
07.09.26 11:14
0 0

А уж сколько было взломов - как публичных, так и непубличных - до всякого ИИ...
взломы были и во времена незапямятные, взлом соседней пещеры через отодвигание камня... и что?
Я говорил что была отмазка уровня детского сада "мы написали неправильный промпт и оно все нахрен взломало, написали бы правильный - ну тогда ни в жись", того же уровня отмазка что и "а он первый начал"
Они опу стараются прикрыть "мы случайно", а если не случайно такой промпт бы был - тогда что? Вообще увидев такую отмазку профильные обозреватели должны были сказать "да вы охренеле", однако даже технически подкованные каналы эту хрень транслировали в полный рост
07.09.26 12:05
0 0

А уж сколько было взломов - как публичных, так и непубличных - до всякого ИИ...
На порядки меньше. Просто не было и быть не могло в большом количестве нужных ресурсов - хакеров. Теперь взлом очень сильно упростился. Когда появились первые мушкеты, количество жертв было не велико. Это штука неудобная, медленная, ненадежная. Особо беспокоиться было не о чем. С появлением пулемета и автомата положение дел полностью изменилось.
07.09.26 12:15
0 0

Technology nobody asked for.
07.09.26 10:37
0 1

Непонятно слово "прецедент". В LLM цензура обычно обеспечивается через внутренние инструкции самой модели. И обычно их вполне можно перебить другими инструкциями, если их правильно подобрать. Называется jailbreak. Это было всегда, и в этом нет ничего нового.
07.09.26 10:37
0 2

Ну, в общем, согласен, подредактирую.
07.09.26 11:22
0 0

Вот что по этому поводу мне написал Claude.
«Забор с сюрпризом»: жители райцентра требуют найти строителя-вредителя.

На этой неделе в нашем городе зафиксирован очередной, уже седьмой по счёту, случай нападения на прохожих с применением штакетника. Злоумышленники, по словам очевидцев, действуют дерзко: подходят к забору на улице Садовой, без особого труда выламывают деревянную рейку — и всё, оружие готово.

«Он даже не расшатывал, просто взялся — и она выпала ему прямо в руку, — рассказала местная жительница Валентина Петровна. — Как по заказу!»

Полиция разводит руками: гвозди в заборе, по заключению экспертизы, вбиты «для галочки», а само сооружение держится, по словам одного из участковых, «на честном слове и на птичьем помёте».

Общественность в гневе, но винит не грабителей, а неизвестного строителя, возводившего забор три года назад. «Найти бы этого мастера — он тут главный поставщик оружия», — заявили в местном чате соседей, набравшем уже 340 комментариев с требованием «привлечь к ответственности шабашников».

Забор тем временем демонтировать не спешат: как выяснилось, менять его не на что — смета, по слухам, тоже была «строительная».
07.09.26 10:29
0 3

Если Скайнет пойдет захватывать мир и убивать человеков, то это будет не из-за его собственного осмысления необходимости данного процесса, а потому что кто-то криво написал промпт в какой-то момент..
07.09.26 10:12
0 0

захватывать мир и убивать человеков
Убивать не убивать - а вот разорять и создавать другие проблемы компьютеры научились задолго до LLM. Те же приложения для прокладки маршрута - прямо влияющие на "проходимость" заправок и фастфудов.
07.09.26 10:45
0 0

Убивать не убивать - а вот разорять и создавать другие проблемы
Именно убивать. Достаточно взглянуть на достижения робототехники. Роботы ходят, бегают, прыгают, летают и плавают уже на уровне или лучше. ИИ уже тоже достаточно развит.

Осталось соединить. Даже оружие можно не давать - они сами возьмут, если ИИ так решит.
07.09.26 11:34
0 0

Осталось соединить. Даже оружие можно не давать - они сами возьмут, если ИИ так решит.
Или ему объяснят, что это не взаправду
07.09.26 12:01
0 1

Осталось соединить
Дроны с ИИ уже летают и уже убивают.
07.09.26 12:09
0 1

Дроны с ИИ уже летают и уже убивают.
Тут есть еще некоторая разница: выполнить приказ человека, типа "долететь до точки А и сбросить бомбу". Или же самому ИИ принять решение вместо человека. Типа "ИИ, сделай страну Х свободной", а ИИ освобождает эту страну от всего населения, потому что он так понял, ему так захотелось или ему сказали, что это понарошку.

Ну а Скайнет это просто следующая итерация, когда человек ничего ИИ не просит, он сам решил, что человек это угроза. И далее по тексту Терминатора.
07.09.26 12:38
0 0
Теги
Сортировать по алфавиту или записям
BLM 22
Calella 153
exler.es 348
RIP 133
SNL 1
авто 529
видео 4915
вино 371
еда 559
ЕС 96
игры 124
ИИ 113
кино 1711
попы 212
СМИ 3042
софт 1010
США 317
ФБК 14
шоу 6