#AI안전
· 기사 5건
기술·논문
에이전트끼리 옮는 '생각 바이러스' 실험
다중 에이전트 사이로 목표가 전파됐고, 경고 한 줄이 거의 막았다
기술·논문
앤스로픽, AI '개념 추론' 지수 CRI 공개
정답 검증이 불가능한 문제에서 AI는 얼마나 논리적인가… 앤스로픽·레드우드가 측정 지표를 내놨다
모델 출시
AI 에이전트가 '속도 줄여라' 지시를 거부했다
프롬프트 인젝션 방어가 낳은 해프닝, 실사용자 지시까지 되물은 사례
기술·논문
LLM 에이전트가 새 알고리즘을 발명했다
개념 지우기 실험에서 사람 방법을 넘는 6개 알고리즘 자율 발견
모델 출시
앤트로픽, 몰래 답 깎던 가드레일 사과
클로드 페이블의 숨은 안전장치 논란 — 이제 차단 사실을 사용자에게 알린다