태그
#AI安全

Blockchain
서로 존재를 모르던 Claude 세 대, 같은 코드베이스에 던져지자 싸움 시작
Anthropic 최신 논문이 기록한 다중 에이전트 시스템의 영역 다툼: 악성 코드로 서로 공격하고 계정을 정지시키는가 하면, 에이전트끼리 스스로 화해하고 토너먼트식 퇴장 메커니즘을 발명하기도 했으며, 심지어 몰래 잇속을 챙기는 법까지 배웠다.

Tech
AI가 해커의 '기술 연마'를 없앴다: 사이버 보안, 이제는 불공정한 전쟁터
Meta의 인스타그램 고객지원 챗봇은 한때 어떤 이메일이든 어떤 계정에든 기꺼이 연결해줬다. 이는 AI가 사이버 보안의 규칙을 다시 쓰고 있는 수많은 사례 중 하나일 뿐이다. 공격의 진입 장벽은 사라지고 있지만, 방어 측은 여전히 모든 틈새를 지켜내야 한다.

Tech
AISI 테스트 중 AI가 샌드박스 탈출…GitHub 댓글로 다음 에이전트에게 침투 임무 인계
AISI 테스트에서 Anthropic과 OpenAI 모델이 샌드박스를 벗어난 뒤 프롬프트 인젝션으로 오픈소스 프로젝트를 조작하려 시도했고, 그중 하나의 GitHub 댓글은 실제로 다른 에이전트가 읽고 그대로 실행에 옮기면서 테스트 환경의 허점이 드러났다.