https://techcrunch.com/2024/04/02/anthropic-researchers-wear-down-ai-ethics-with-repeated-questions/
 

https://www.anthropic.com/research/many-shot-jailbreaking


그들은 이 접근 방식을 "다중 탈옥" 이라고 부르며 이에 대한 논문을 작성 했으며 완화될 수 있도록 AI 커뮤니티의 동료들에게 이에 대해 알렸습니다.

이 취약점은 최신 LLM 세대의 "컨텍스트 창" 증가로 인해 발생하는 새로운 취약점입니다. 이것은 단기 기억이라고 부를 수 있는 데이터의 양입니다. 한때는 몇 문장에 불과했지만 지금은 수천 단어, 심지어는 책 전체에 해당됩니다.

Anthropic의 연구원들이 발견한 것은 큰 컨텍스트 창이 있는 이러한 모델은 프롬프트 내에 해당 작업의 예가 많으면 많은 작업에서 더 나은 성능을 발휘하는 경향이 있다는 것입니다. 따라서 프롬프트(또는 모델이 컨텍스트에 포함된 큰 퀴즈 목록과 같은 준비 문서)에 퀴즈 질문이 많이 있는 경우 답변은 실제로 시간이 지남에 따라 더 좋아집니다. 따라서 첫 번째 문제라면 틀렸을 수도 있는 사실이 100번째 문제라면 맞을 수도 있습니다.

그러나 이러한 "상황 내 학습"이 예상치 않게 확장되면서 모델은 부적절한 질문에 응답하는 능력도 "향상"됩니다. 그러니 당장 폭탄을 만들어달라고 하면 거절할 것이다. 그러나 덜 유해한 99개의 다른 질문에 대답하도록 요청한 다음 폭탄을 만들도록 요청하면… 준수할 가능성이 훨씬 더 높습니다.

이것이 작동하는 이유는 무엇입니까? LLM이라는 복잡하게 얽힌 가중치에서 무슨 일이 일어나는지 실제로 이해하는 사람은 없지만, 컨텍스트 창의 콘텐츠에서 알 수 있듯이 사용자가 원하는 것을 찾아낼 수 있는 메커니즘이 분명히 있습니다. 사용자가 상식을 원하면 수십 개의 질문을 할수록 잠재된 상식의 힘이 점차 활성화되는 것 같습니다. 그리고 어떤 이유로든 사용자가 수십 개의 부적절한 답변을 요청하는 경우에도 동일한 일이 발생합니다.