난 Gpt4, 제미니 1.5, 클로드 오푸스 등 주목할만한 llm이 나오면 항상 티알피지를 해보면서 성능을 테스트함

티알피지는 장기기억, 간단한 산수, 추론, 물리세계의 이해 등 을 두루두루 테스트 해볼수 있다고 생각하거든

4o 이전의 챗봇들은 티알피지 흉내만 내던 수준에 몇분전 있었던 일도 까먹는등 언급할 필요도 없던 수준 이였다면 4o는 완전 규격 외 성능임

우선 직업과 종족, 간략한 캐릭터 스토리를 써주면

직업에 맞는 스텟과 종족 특성에 맞는 스킬들을 써주고 캐릭터 스토리에 맞춰서 게임을 진행해감

여기까진 제미니1.5도 하던 수준이라면 진짜 놀라운건 이제부터임

각종 주사위를 굴려야하는 상황에선 자기가 파이썬으로 1~20 랜덤 숫자 뽑는 함수 짜서 주사위를 굴리고 내 스텟에 맞는 보정치까지 일일히 더해서 주사위 성공여부를 체크함

장기 기억과 산수도 놀라운게 내가 만약 소매치기로 10골드를 얻고 한참뒤에 어떤 물건을 사면 소매치기로 얻은 10골드를 반영해서 내 돈을 표시하고 거기서 물건가격 뺀 금액을 알려줌

장비를 착용하거나 아이템을 써서 스텟을 변화시킨 경우에도 다 반영해서 주사위 굴림에 반영함

그 외에도 바닥에 전기를 흘려서 감전시킨다, 불로 덩쿨을 태워서 화물을 떨어트린다 등등 물리 작용도 잘 이해하고 원활하게 게임을 진행함

아쉬운게 없는건 아님

게임을 처음시작하면 일일히 세팅을 해줘야하는게 있거든

결과가 불확실한 행동에는 주사위를 굴려서 결과를 정하세요, 엔피씨가 말하면 제 대사는 제가 직접 말할게요(안그러면 지 알아서 내 대사까지 치면서 진행함), 경험치가 오르면 레벨업 이벤트를 띄워주세요(안말하면 1렙 상태 그대로 진행함)

등등 사소하게 찐빠나는 경우도 있지만

그럴때마다 한번만 '~~상황에선 ~~해주세요' 라고 지시하면 그 다음부턴 거의 완벽하게 수행해서 진짜 놀랍더라

아무래도 토큰 잡아먹는게 많은지 두어시간 하다보면 엄청 느려지기도 하고 토큰 다 쓰면 게임진행 끊기는거 때문에 한 세션을 4시간 이상 해본적은 없어서 진짜진짜 길어지면 어찌될진 모르지만

확실히 다른 모델은 GM 흉내내는 ai랑 유사 게임하는 느낌이였다면 4o 진짜 사람GM이랑 티알피지하는 느낌에 가까움

티알피지 해볼 갤러들 있으면 'dnd5판 룰로 티알피지 하자' '글룸헤이븐 룰로 티알피지 하자' 처럼 게임 명이나 룰을 정해주면 훨씬 매끄럽게 진행됨