Анализ уязвимостей LLM: Проблемы и решения

Статья представляет собой анализ архитектурных ограничений языковых моделей (LLM) и уязвимостей, возникающих из-за промпт-инъекций. За три года после первой инъекции технологии не смогли достичь надежного уровня защиты, несмотря на значительные усилия в области безопасности. Недавний случай, когда школьник из Небраски обошёл защиту дорогой модели, лишь подтверждает эту проблему. Уязвимости возникают из-за механик Attention и токенизации, где данные и инструкции не разделяются, что позволяет атакующим манипулировать моделью. Архитектура трансформеров не позволяет внедрить жесткий контроль доступа, что ведет к тому, что модели забывают важные правила в длинных диалогах. Проблема усугубляется тем, что модели обучаются на ограниченных данных, и их поведение не предсказуемо в неизведанных контекстах. В итоге, безопасность LLM остаётся под угрозой, пока не будет изобретена новая архитектура, основанная на символьном понимании.