Разработка и безопасность ИИ
Привет! Я старший разработчик систем искусственного интеллекта в Innostage. Работаю на стыке машинного обучения и информационной безопасности. Здесь модель уже не ограничивается ответами на вопросы. Она получает доступ к данным, инструментам и бизнес-процессам.
Если совсем коротко: ИИ можно взломать. Иногда для этого не нужны сложные эксплойты. Хватает текста. А когда модель подключена к RAG, почте, базе данных или набору инструментов, последствия довольно быстро перестают быть игрушечными.
ИИ не магический чёрный ящик. Это довольно сложный программный контур. В нём есть данные, зависимости, доступы, пользователи, разработчики и модель, которая может галлюцинировать или послушаться не той инструкции. Поэтому я смотрю на всю систему целиком.
Смотрю, где модель соприкасается с чувствительными данными, внешними сервисами, RAG и инструментами. И что произойдёт, если один из этих элементов будет скомпрометирован.
Промпт-инъекции, утечки контекста, вредоносные документы, обход ограничений и лишние права у агентов. Лучше найти это самим, чем однажды прочитать об этом в отчёте об инциденте.
Разделение прав, фильтрация, журналирование, контроль данных, guardrails и ручная проверка там, где цена ошибки высока. Надежды на один волшебный фильтр здесь обычно не работают.
Разработчиков, ML-инженеров и специалистов по безопасности. Показываю, как выглядят атаки на практике и почему безопасность ИИ не заканчивается системным промптом.
LLM особенно занятная цель для атак. Обычно, чтобы взломать программу, приходится искать уязвимость в коде. Здесь иногда достаточно убедительно с ней поговорить.
Сейчас больше всего смотрю на прямые и косвенные промпт-инъекции, отравление RAG и вредоносные документы. Отдельная головная боль: внешние модели, зависимости и цепочка поставок.
Дальше начинаются агенты. Им выдают лишние права, разрешают действовать самостоятельно, а потом удивляются утечкам данных и системных инструкций. И где-то рядом всегда человек, который верит уверенному ответу.
Я начинал с психологии: семь лет изучал поведение человека, защитил магистерскую работу по психологическому благополучию и несколько лет преподавал. Затем ушёл в Data Science, работал с ML в ритейле и FoodTech, а позже пришёл в информационную безопасность.
Психология никуда не делась. Люди очеловечивают модель, доверяют уверенным ответам, подключают к ней всё больше данных и выдают всё больше прав. Поэтому мне особенно интересен стык моделей, инфраструктуры и человеческой веры в то, что «нейросеть сама разберётся».
На случай, если вы пришли из поиска: Александров Лебедевых в интернете много. На Хабре я пишу под именем @Psyhoved, а ещё веду Telegram-канал «Философия AI». Этот сайт относится именно ко мне.
For English-language search: Alexander Lebedev is an AI systems developer at Innostage working on AI security, LLM security, MLSecOps, prompt injection, AI red teaming and secure agentic systems.