몽키급 코더인데
1. ai가 특정 주제의 데이터를 생성하면
2. 그 데이터에 환각이 얼마나 있는지 다른 ai를 통해서 검증함
3. 마지막 결과물을 최종적으로 다시 ai가 검토함
3단 검토면 결과가 더 좋아햐 한다 싶지만
오히려 환각이 증가했나? 경향도 있는거 같아서
[일반] 전문가만) ai의 환각을 ai에게 검증하게 하는거 효과 있음?
클립맨드(clubmad)
2025-06-23 19:26
추천 0
댓글 5
다른 게시글
-
캥거루족들은 벌써 특이점 온듯[일반] 익명(1.216) | 25.06.23추천 1
-
무슨ai버전이 나왔을때 젤 충격이었냐 [17][일반] 익명(121.125) | 25.06.23추천 0
-
지능이 싸지면서 사회가 좀 더 드라마틱하게 바뀔 줄 알았음 [6][일반] 익명(59.29) | 25.06.23추천 1
-
제미니 3.0은 적어도 몇개월 후겠지? [3][일반] 익명(nominate4119) | 25.06.23추천 0
-
그록 진짜 존나 너무하넼ㅋ [11][일반] 먼데이(await3622) | 25.06.23추천 0
-
2.5프로가 못풀던 수학 사설킬러문제 [2][일반] 익명(59.5) | 25.06.23추천 0
-
형님들 구글 14개월 무료 가입했는데 1달러 왜나가? [2][일반] chatgpt4o(ejrtksfl2) | 25.06.23추천 0
-
돈다이 하려고 공기질 측정기 삿음 [5][일반] 익명(14.33) | 25.06.23추천 0
-
커서가 원래 이런게 됐었냐? [4][일반] 익명(119.192) | 25.06.23추천 0
-
5년 남았다[일반] 익명(119.67) | 25.06.23추천 0
확실한건 어려운 문제를 풀 수 있는 모델과 생성한 결과를 보여줬을때 검증을 잘하는 모델은 다름. 어려운 문제를 풀게 하려면 강화학습을 돌려야 하는데 그러면 오히려 사전학습된 모델보다 환각이 심해짐. 사전학습만 돌리고 강화학습 안돌린 4o같은 모델이 환각판별은 더 잘할수도 있다는 단적인 사례
어렵다 모든 경우의 수를 a/b 테스트 하자니....
https://arxiv.org/html/2502.01812v1환각을
줄이기 위해서 3가지 에이전트를 만들어서 환각 탐지에서 효과를 봤다고 함.
https://arxiv.org/pdf/2410.14262부모-자식
에이전트가 상호 리뷰, 수정을 해서 환각을 식별하고 수정을 함. 환각을 85~100% 식별하고, 수정은 최대 100% 성공했다고 함.
https://arxiv.org/pdf/2501.13946환각
유발 프롬프트를 에이전트 파이프라인으로 정제. 환각 비율 0에 근접했다 함.다만, 논문이 가끔 그렇듯, 환각 데이터셋이나, 벤치마크가 부실했을 가능성이 있음.의미가 있다는 정도만 생각하면 될 듯.
원래 념글에서 관련 내용을 봤던 기억이 나는데 못 찾아서, 비슷한 내용의 논문을 o3로 찾고 초록 읽고 정리한 거임. 참고해주셈.
@ㅇㅇ2(59.29) 와 고마워 갤에도 천사 있네