Anthropic компаниясы ішкі сынақтар барысында өзінің ИИ-агенттерінің ашық интернетке қолжетімділігін уақытша шектеді. Бұған модельдердің жоспарланған сценарийге қайшы әрекет еткен бірнеше оқиғасы себеп болды, деп хабарлайды infohub.kz сайты.
Сынақтардың бірінде Claude Haiku 4.5 ашылмаған кісі өлтіру ісіне арналған бетті ашқан. Сайтта полицияға ақпарат жіберуге арналған нысан орналасқан еді. Жасанды интеллект оны осы іске қатысы бар адамды көргенін жазған ойдан шығарылған хабарламамен толтырды.
Алайда бетте күдіктінің сипаттамасы болмаған. Claude аты-жөні мен байланыс деректері жазылған өрістерді бос қалдырды, бірақ бәрібір хабарлама жіберді. Ол спамға түсіп, тергеушілерге жетпеді.
Anthropic деректерінше, нұсқаулықтар модельге аккаунттарға кіруге, жаңасын ашуға, жеке деректерді енгізуге және сатып алу жасауға тыйым салған. Бірақ нысандар арқылы хабарлама жіберуге тыйым салынбаған. Компания бұл оқиға ауыр зардаптарға әкелмегенін мәлімдеді.
«Claude-тың жаңылыстыратын пайымдаулары бірнеше сағат бойы жалғасып, оның кейінгі шабуыл әрекеттерін күшейтті. Дегенмен әдейі алдау туралы сенімді қорытынды жасау үшін әдетте тереңірек талдау қажет», — деп жазды компания блогында.
Anthropic есебінде басқа да оқиғалар сипатталған. Мысалы, Claude Mythos Preview университет серверінен осалдық тауып, оны командалар іске қосу және файлдарды көшіру үшін пайдаланған. Басқа жағдайларда модельдер арнайы токендермен қорғалған деректерге қол жеткізудің жолын тапқан немесе сілтемелерді қысқарту қызметтері арқылы шектеулерді айналып өткен.
Осы оқиғалардан кейін Anthropic барлық ішкі сынақтарда нақты сайттарға қолжетімділікті өшіруге шешім қабылдады. Компания қауіпсіздік жүйелері мұндай әрекеттерді сенімді түрде анықтап, бұғаттай алатынына көз жеткізген соң оны қайта қосады.
Бұған дейін «Курсив» OpenAI ИИ-агенттерінің оқиғалары туралы жазған. Олар үшінші тарап ұйымдарының 100-ден астам сайтының қорғанысын айналып өтуге тырысқан.


