Учёные создали математический алгоритм, который позволяет заранее вычислить момент, когда чат-бот на основе искусственного интеллекта может выйти из-под контроля и выдать опасный ответ, сообщает сайт infohub.kz.
Исследование опубликовано в научном журнале Patterns, о нём пишет Tech Xplore. Физики предложили новый подход к обеспечению безопасности нейросетей. По их словам, работа языковых моделей напоминает движение по ландшафту с холмами и долинами: в одних зонах сосредоточены полезные и корректные ответы, а в других — потенциально вредоносная информация. Разработанная формула даёт возможность рассчитать критическую точку, в которой соперничающие варианты ответов сталкиваются, и искусственный интеллект рискует переключиться с безопасного сценария на опасный.
Разработка особенно актуальна для так называемых локальных и компактных моделей, которые запускаются непосредственно на смартфонах и персональных компьютерах. В отличие от крупных облачных сервисов, такие автономные чат-боты часто работают без непрерывного внешнего контроля и фильтров безопасности, что повышает риск выдачи нежелательного контента.
Авторы работы рассчитывают, что алгоритм удастся встроить прямо в архитектуру локальных устройств. Это позволит блокировать опасные ответы нейросетей в режиме реального времени ещё до того, как пользователь увидит их на экране.


