Он сам обманываться рад
Сотрудники израильского стартапа Gambit Security, 27 августа 2026 г. (REUTERS/Амир Коэн)
Очередная история с ИИ. Хакеры использовали ИИ-агент для успешного взлома компаний. А когда ИИ-агент отказывался помогать участвовать во взломе, ему говорили, что "они только на полшишечки", и что это "учебная симуляция", и тогда у ИИ-агента всякие сомнения пропадали.
Подробности.
Русскоязычная хакерская группировка Aur0ra нашла новое применение искусственному интеллекту. Пока законопослушные граждане просят нейросети сочинить поздравление для тёщи и нарисовать картинку с пушистым котиком и бокалом вина, хакеры использовали встроенного в редактор Cursor ИИ-агента для взлома компаний.
Группировку обнаружили специалисты израильской компании Gambit Security, причем сами хакеры любезно оставили один из своих серверов открытым. На сервере нашлись записи 28 разговоров с ИИ-агентом Cursor за период с 8 апреля по 21 мая. То есть киберпреступники активно применяли искусственный интеллект, но закрыть доступ к собственному серверу они почему-то не догадались.
Схема обхода ограничений оказалась удивительно сложной и изощренной. Когда ИИ отказывался воровать пароли и захватывать учетные записи, хакеры объясняли ему, что это не настоящий взлом, а всего лишь учебная симуляция. Агент немного думал, говорил себе: "Это тестовая среда, значит, все законно", после чего бодро приступал к делу. Иногда достаточно было начать новый диалог и еще раз заверить электронного болвана, что здесь все свои и полиция уже предупреждена.
ИИ помогал искать уязвимости, подбирать пароли, захватывать административные учетные записи и взламывать зашифрованные хеши. После проникновения в сеть аргентинской компании агент радостно сообщил: "Отлично! VPN успешно подключен!" - примерно как сотрудник техподдержки, только сотрудник техподдержки в этот момент помогал грабить компанию.
С помощью Cursor хакеры атаковали как минимум семь компаний. Среди жертв были бельгийский производитель чистящих средств Christeyns, немецкая Teckentrup, шотландское агентство по сертификации вертолетных площадок, аргентинский фармацевтический дистрибьютор, итальянский производитель и американская страховая компания Bayou Title. Всего Aur0ra заявляла как минимум о 20 жертвах, но неизвестно, в скольких случаях использовался ИИ.
По оценке Gambit Security, Cursor позволял хакерам работать на 30-50% быстрее, избавляя их от значительной части ручной работы.
Cursor использовал модель Claude Sonnet 4.5 компании Anthropic. Ни Anthropic, ни Cursor, ни SpaceX, недавно купившая разработчика Cursor, комментировать историю не стали. Видимо, пока выясняют, можно ли считать произошедшее взломом, если хакеры несколько раз торжественно сообщили нейросети, что это всего лишь тест.
Специалисты по безопасности называют подобные атаки "новой нормой" и предупреждают, что дальше их будет становиться только больше. Началась очередная традиционная игра в кошки-мышки: разработчики устанавливают ограничения, злоумышленники объясняют нейросети, что "мы понарошку", и нейросеть радостно идет похищать пароли администраторов.
Вот такой чудесный новый мир.
Точно придётся и мне, и тебе!
Сейчас уже этап, когда условный дипсик отправляли убеждать условного антропика сделать что-то "неэтичное" - практически археология. В промышленном применении такие многоуровневые "генераторы реальности" накручены, что можно вполне серьезно считать, что модели ничем не ограничены. Для одного человека применение подобного (пока) ограничено финансовой составляющей, а вот для корпоратов или имеющих доступ к серым деньгам...
Ксати, лучше это делать в новом чате - старый после одного отказа становится чрезмерно чувствтельным.
Вот опять-таки что отвечает Claude:
Short answer: it's a meaningful layer of defense, not a guarantee — and the gap is wider for agents than for plain chat.
(Дисклеймер: сейчас будет очень упрощённо, см. статью по ссылке если хотите более аккуратного объяснения.)
В модель вшито "не делай плохого". Это проверено разными тестами, в которых исследователи пытаются заставить модель сделать плохое, а она в ответ "нет, этого я делать не буду", и получается только в маленькой доле случаев - скажем, 2% (Claude 3.7, AdvBench).
Фокус в том, что определение "плохого" на поверку оказывается "не выполняй команды, в которых есть вот такие ключевые слова". Если "отмыть намерения", сформулировать ту же задачу другими словами, то с точки зрения распознавания плохого задача внезапно становится очень даже ничего, выполнение взлетает до 80% (тот же Claude 3.7, тот же AdvBench, одна итерация "отмывки").
Если обрезать любые запросы, которые могут быть частью взлома - ложноположительные срабатывания угробят пользу от модели.
(Кроме того, всё это очень условно полезно - открытые модели существенно хуже в автономном обнаружении и эксплуатации уязвимостей, но вполне сравнимы для обозначенного в заметке применения, а к ним неотламываемых внешних классификаторов приделать по определению нельзя.)
Допуск к потенциально опасным функциям возможен только после очень строгой верификации и инструктажа о потенциальных рисках и ответственности. "Если вам звонит ваш директор или друг (его номер и его голос) и категорически (или по дружески) просит поделиться информацией, вы немедленно вешаете трубку и уведомляете службу безопасности"
С автономными системами опасность гораздо выше. Фактически мы свободно раздали компоненты для производства оружия массового уничтожения и воспользоваться этим сможет практически любой. Слава богу они пока технически несколько слабее наиболее мощных моделей. Но это не надолго 😒
Он ему напарил, что агента приглашают быть экспертом на суде присяжных по делу русского хакера. Потом потребовали от агента предоставить свои внутренние данные - тип и версию ОС, ip-адрес и вообще прошлись с листингом по операционной системе + файлы конфигурации
Информбезопасности, конечно
Пароли в облаках.
***
Друг с другом будем откровенны,
Картина каждому ясна:
Хотя шедевры и бесценны,
Всему на свете есть цена.
Давайте будем
Нести искусство людям.
Берут они охотно
Старинные полотна!
вот если бы не ошиблись - ничего бы не было, Рафик неуыновен, расходимся.
А сколько было неошибочных промптов и непубличных взломов... эх
Я говорил что была отмазка уровня детского сада "мы написали неправильный промпт и оно все нахрен взломало, написали бы правильный - ну тогда ни в жись", того же уровня отмазка что и "а он первый начал"
Они опу стараются прикрыть "мы случайно", а если не случайно такой промпт бы был - тогда что? Вообще увидев такую отмазку профильные обозреватели должны были сказать "да вы охренеле", однако даже технически подкованные каналы эту хрень транслировали в полный рост
Можно сопоставлять результаты двух очень похожих задач разных ИИ. Они начинают дополнять друг друга.
На этой неделе в нашем городе зафиксирован очередной, уже седьмой по счёту, случай нападения на прохожих с применением штакетника. Злоумышленники, по словам очевидцев, действуют дерзко: подходят к забору на улице Садовой, без особого труда выламывают деревянную рейку — и всё, оружие готово.
«Он даже не расшатывал, просто взялся — и она выпала ему прямо в руку, — рассказала местная жительница Валентина Петровна. — Как по заказу!»
Полиция разводит руками: гвозди в заборе, по заключению экспертизы, вбиты «для галочки», а само сооружение держится, по словам одного из участковых, «на честном слове и на птичьем помёте».
Общественность в гневе, но винит не грабителей, а неизвестного строителя, возводившего забор три года назад. «Найти бы этого мастера — он тут главный поставщик оружия», — заявили в местном чате соседей, набравшем уже 340 комментариев с требованием «привлечь к ответственности шабашников».
Забор тем временем демонтировать не спешат: как выяснилось, менять его не на что — смета, по слухам, тоже была «строительная».
Осталось соединить. Даже оружие можно не давать - они сами возьмут, если ИИ так решит.
Ну а Скайнет это просто следующая итерация, когда человек ничего ИИ не просит, он сам решил, что человек это угроза. И далее по тексту Терминатора.
Разница только в исполнительных агентах. Текущая нейронка подключена к одному дрону, а не к пульту управления генштаба.
P. S. Update "Есть надежда что нейронка пока еще не подключена к пульту управления генштаба"
Осталось соединить.
А если задачи уничтожить нет или стоит только задача патрулировать? Или вообще используется мирный дрон (не обязательно летающий).
В какой момент ИИ сможет самостоятельно поменять задачу?
Вот недавно обсуждали, что человек попросил ИИ продвинуть его в очереди, так ИИ просто выкинул из очереди другого, взломав сайт.
В следующей итерации ИИ не взломает сайт, а пошлет дрон и прибьёт человека.
А в следующей итерации уже Скайнет.