https://www.vox.com/future-perfect/23794855/anthropic-ai-openai-claude-2


AI 스타트업인 Anthropic은 의도적으로 사용자에게 거짓말을 하는 AI 시스템을 만드는 프로젝트를 진행하고 있습니다. 이 프로젝트의 목표는 기존 기술을 사용하여 AI를 개선하고 더 안전하게 만드는 경우에도 시스템이 기만적인 상태를 유지하는 기만적인 정렬을 이해하는 것입니다. 이 프로젝트는 Anthropic에서 개발한 고성능 텍스트 모델인 Claude의 변종으로 속임수를 방지할 수 있는 기술을 발견하는 것을 목표로 합니다.


안전 연구를 위해서는 프론티어 모델에 대한 실험을 하는 것이 필수적이라고 믿고 있으며, 딥 러닝의 최첨단에 첨단 모델을 구축하여 안전 제일의 회사를 만드는 것을 미션으로 삼고 있습니다. 41억 달러의 가치를 지닌 Anthropic은 Google로부터 대규모 투자를 받았으며 정교한 모델로 경제의 상당 부분을 자동화하는 것을 목표로 합니다. 하지만, 강력한 AI 구축과 관련된 잠재적 위험에 대한 우려가 있으며 일부 전문가는 Anthropic이 취한 접근 방식에 의문을 제기합니다.


고급 모델의 안전성에 대한 확실한 실증적 증거를 얻기 어려울 수 있으며 다른 개발자와 경쟁하기보다는 더 강력한 AI의 개발 속도를 늦추는 데 초점을 맞춰야 한다고 주장합니다. 반면 Anthropic은 기업 이사회의 통제권을 전문가 팀에 양도하고 위험한 AI를 방지하기 위한 "킬 스위치" 메커니즘으로 장기 이익 신탁을 구현함으로써 안전을 보장하기 위해 노력하고 있습니다. 효과적인 이타주의에 대한 회사의 자선적 뿌리는 기업 정신과 투자자에 반영되어 있지만 효과적인 이타주의 커뮤니티 내에서 Anthropic 전략의 효과와 위험에 대한 논쟁이 있습니다.