Разработка и безопасность ИИ

Александр Лебедев. Разрабатываю ИИ и занимаюсь его безопасностью

Привет! Я старший разработчик систем искусственного интеллекта в Innostage. Работаю на стыке машинного обучения и информационной безопасности. Здесь модель уже не ограничивается ответами на вопросы. Она получает доступ к данным, инструментам и бизнес-процессам.

Если совсем коротко: ИИ можно взломать. Иногда для этого не нужны сложные эксплойты. Хватает текста. А когда модель подключена к RAG, почте, базе данных или набору инструментов, последствия довольно быстро перестают быть игрушечными.

Что именно я делаю

ИИ не магический чёрный ящик. Это довольно сложный программный контур. В нём есть данные, зависимости, доступы, пользователи, разработчики и модель, которая может галлюцинировать или послушаться не той инструкции. Поэтому я смотрю на всю систему целиком.

Разбираю архитектуру

Смотрю, где модель соприкасается с чувствительными данными, внешними сервисами, RAG и инструментами. И что произойдёт, если один из этих элементов будет скомпрометирован.

Пробую сломать систему

Промпт-инъекции, утечки контекста, вредоносные документы, обход ограничений и лишние права у агентов. Лучше найти это самим, чем однажды прочитать об этом в отчёте об инциденте.

Помогаю собрать защиту

Разделение прав, фильтрация, журналирование, контроль данных, guardrails и ручная проверка там, где цена ошибки высока. Надежды на один волшебный фильтр здесь обычно не работают.

Обучаю команды

Разработчиков, ML-инженеров и специалистов по безопасности. Показываю, как выглядят атаки на практике и почему безопасность ИИ не заканчивается системным промптом.

Что мне особенно интересно

LLM особенно занятная цель для атак. Обычно, чтобы взломать программу, приходится искать уязвимость в коде. Здесь иногда достаточно убедительно с ней поговорить.

Сейчас больше всего смотрю на прямые и косвенные промпт-инъекции, отравление RAG и вредоносные документы. Отдельная головная боль: внешние модели, зависимости и цепочка поставок.

Дальше начинаются агенты. Им выдают лишние права, разрешают действовать самостоятельно, а потом удивляются утечкам данных и системных инструкций. И где-то рядом всегда человек, который верит уверенному ответу.

Как я вообще здесь оказался

Я начинал с психологии: семь лет изучал поведение человека, защитил магистерскую работу по психологическому благополучию и несколько лет преподавал. Затем ушёл в Data Science, работал с ML в ритейле и FoodTech, а позже пришёл в информационную безопасность.

Психология никуда не делась. Люди очеловечивают модель, доверяют уверенным ответам, подключают к ней всё больше данных и выдают всё больше прав. Поэтому мне особенно интересен стык моделей, инфраструктуры и человеческой веры в то, что «нейросеть сама разберётся».

Что можно почитать и посмотреть

На случай, если вы пришли из поиска: Александров Лебедевых в интернете много. На Хабре я пишу под именем @Psyhoved, а ещё веду Telegram-канал «Философия AI». Этот сайт относится именно ко мне.

For English-language search: Alexander Lebedev is an AI systems developer at Innostage working on AI security, LLM security, MLSecOps, prompt injection, AI red teaming and secure agentic systems.

Made on
Tilda