못푼대서 내봤는데 잘맞히노
[일반] 초성퀴즈 잘푸는데?
익명(grass8185)
2025-05-19 19:01
추천 0
댓글 39
다른 게시글
-
그런데 너희들은 전유물이 불가능하다고 생각하냐 [28][일반] 익명(14.50) | 25.05.19추천 1
-
챗아레나 신모델 떴노 [2][일반] 익명(casual4750) | 25.05.19추천 1
-
폰 노이만 할배가 비이브코딩 봤으면 뭐라했을까 [11][일반] 익명(somehow8885) | 25.05.19추천 0
-
돈좀 써라 징징대지말고 [3][일반] 약팔이아님(vital7966) | 25.05.19추천 2
-
바이브코딩도 아직은 노하우의 영역임. [4][일반] 익명(220.72) | 25.05.19추천 0
-
젬마 환각 ㅈㄴ 심하던데[일반] 익명(14.50) | 25.05.19추천 0
-
하사비스 근황 ㄷㄷ[일반] 익명(triangle9268) | 25.05.19추천 6
-
바이브코딩 10만줄 넘어가면 걍 병신되네 [19][일반] 한가할때(bell3627) | 25.05.19추천 0
-
합성데이터 모델 붕괴는 다 옛말인데[일반] 익명(casual4750) | 25.05.19추천 0
-
한국은 인공지능 시대 살아남을 수 있으려나[일반] 익명(121.188) | 25.05.19추천 0
ㅎㅇㅌ ㅎㅇㅅ ㄷㅇ / ㅆㅋㅅ ㅍㅁㄹ / ㄴㅁㅎㄱ ㅂㅂㄷ / ㅎㅇㄴㅇ, ㅁㅅㅌ ㄹ / ㅊㅁ:ㅎㄴㅇ ㅁㄴㄷ
이렇게 다섯개 풀어보라고 해봐. 영화제목이고, 하나 빼고는 다 한국영화임. 바람과 함께 사라지다는 초성 자체가 학습 데이터셋에 있을 확률이 높을듯
2345는 나도 못맞히겠는데 듣보영화임?
화이트 하우스 다운(여기부터는 살짝 애매한데, 혹시 한 글자 정도 힌트를 더 주실 수 있을까요?)(위와 동일하게, 혹시 몇 개의 초성이 더해지거나 제외된 건 아닌지 알려주시면 딱 맞춰볼 수 있을 것 같습니다!)(콤마가 들어간 제목이라니 정말 흥미로운데요… “ㅎㅇㄴㅇ, ㅁㅅㅌ ㄹ”의 “ㅎㅇㄴㅇ”이 한 단어라면 어떤 느낌인지 힌트를 주실 수 있을까요?)(콜론 뒤에 붙는 부제까지! “ㅊㅁ:ㅎㄴㅇ ㅁㄴㄷ”은 어떤 장르의 영화인지, 또는 원제의 영어 첫 글자 정도라도 알려주시면 도전해 보겠습니다.)화이트하우스다운은 첫추론때 원큐에 맞히고 나머지는 걍 그런 영화가 있는지를 몰라서 못맞히는거같은데
썬키스 패밀리 / 노무현과 바보들 / 힘을내요, 미스터 리 / 천문:하늘에 묻는다
죄다 처음듣는 영화노 ㅋㅋㅋㅋ
초성퀴즈 자체로 학습데이터에 포함되지 않을 가능성이 높은 영화들 위주로 뽑은거임
애초에 인간이 초성퀴즈 맞히는것도 학습데이터(본인이 적어도 들어본 적은 있는 영화) 범주 내에서 맞히는건데 이거 못맞힌다고 지능이 없다고 생각하는게 이상한거라고 봄
말을 약간 곡해할 수 있을 것 같아서 다시 적자면 학습 데이터 자체에 힘을내요 미스터 리 같은 영화가 들어가긴 하는지 알 수 없는 상황이니 이 결과만 가지고 지능이 있는지 여부를 체크하는게 확실하지 않은 방법이라는 소리
그라운딩 같은 인터넷 검색 연결을 끊고 저 영화들에 대한 설명을 요구해서 나오면 학습데이터에 포함됐는지 판별할수 있을듯
썬키스 패밀리랑 노짱 빼고는 다 맞히네
o3 기준 웹검색 사용을 금지한 상황에서 네가지 영화에 대해 디테일한 내용 설명이 가능한거 확인했음
@ㅇㅇ1(220.72) 뭔 개병신영화들만들고왔냐
@ㅇㅇ1(220.72) 내가 질문한 모델은 o4-mini인데, 검색 없이 해당 영화들의 시놉시스를 적어보라고 했을 때 죄다 뚱딴지같은 소리만 적어놨음.
@Protactinium 메가히트한 영화나 클래식 수준의 영화라면 이미 초성퀴즈로 만들어진 웹 데이터셋이 있을 확률이 높으니, 그런 식으로 활용이 안되었을법한 영화들 들고온거임. o3 기준 위 영화들 내용을 웹검색 없이 뱉어낼 수 있는건 확인했음
@ㅇㅇ1(220.72) 디테일한 내용 설명이 정확한지는 검증해봄? 아무 개소리나 지껄이던데
@ㅇㅇ o3 기준으로 배우랑 시놉시스가 원래 영화랑 매치되는거 확인했음. o4-mini-high 에서는 헛소리하고. 학습 데이터셋이 다른건지, 데이터셋에서 추출하는 방법론이 틀린건진 모르겠네. o3가 웹검색을 하지 말라는 말을 무시하고 웹검색을 했을 가능성도 있어보임
@ㅇㅇ o4-mini-high 기준 천문:하늘에 묻는다 말고는 다 개소리네
@ㅇㅇ1(220.72) 재밌다! 내가 맞혀본 답은 이렇다구 + 화이트 하우스 다운 썬키스 패밀리 노무현과 바보들 힘을 내요, 미스터 리 천문: 하늘에 묻는다초성만 보고 머리 굴려봤는데, 다 맞았길! 또 내줘봐 +o3한테 동일한 퀴즈 설명 및 문제 제출(힘을내요는 힘을 내요가 문법상 맞아서 고쳐주긴 함)한 결과
@ㅇㅇ 7분동안 추론함
@ㅇㅇ 채팅 기록 참고 끄고 한거 맞음? 저걸 한번이라도 니 계정에서 물어봤으면 GPT는 채팅 기록을 근거로 찾아낼 수 있어보임.
@ㅇㅇ 채팅기록 끄고 맞춘게 맞으면, o3는 초성 데이터셋 없이 저걸 맞춰낼 수 있을만한 지능이 있는게 맞음
@ㅇㅇ1(220.72) 죄다 임시채팅에서 물어본거라 기록 안남음 ㅇㅇ
@ㅇㅇ 일단 채팅기록 참고 끄고한 결과, 1shot으로는 다 못맞추는게 맞는데, 그래도 추론을 바탕으로 단어들을 맞춰가는 과정이 흥미롭긴 하네. 추론과정을 보면서 든 생각은, 정보 서칭 능력에 대한 검사일 수는 있어도 추론에 대한 검사로는 부족해보이는 검사인거같음. 결과 나오면 링크드림
@ㅇㅇ1(220.72) 다른애 한명도 o3로 물어본 결과 4분 37초 걸려서 다맞히긴 했네
학습 안한건 당연히 못맞추지 맞추는게 이상한거 아닌가?
다른 ai 모델(객체 탐지나 분류같은)은 훈련 데이터에 없어도 맞히는 거 보고 LLM도 마찬가지일거라고 생각한 듯
원래 문제제기했던 글 자체가, 'LLM의 지능이 허상이다' 라는걸 논지로 들고나온거임. 학습 데이터에 없는 새로운 추론이 불가능함을 주장한거고, 그걸 반박하려면 초성퀴즈 자체가 데이터에 있지 않은 무언가를 추론해내는 지능이 있어야 하는거
예컨대, 사람은 'ㄴㅇㅍㄹㅋㄱㅎㄱ' 이라는 초성퀴즈를 본 적이 없어도, '남아프리카공화국' 이라는 나라가 존재함을 알고 있으면 'ㄴㅇㅍㄹㅋㄱㅎㄱ' 이라는 초성퀴즈를 보고 맞추는 추론이 가능함. 근데 LLM은 '남아프리카공화국' 은 알아도 'ㄴㅇㅍㄹㅋㄱㅎㄱ' 이라는 초성퀴즈를 학습한적이 없다면 못푸는거 아님? 이라고 물어본게 원래 문제제기 내용인거고
@ㅇㅇ1(220.72) 그렇게 따지면 본문도 바람과 함께 사라지다는 알아도 ㅂㄹㄱ ㅎㄲ ㅅㄹㅈㄷ를 모르는데 추론해서 맞혔자나?
@ㅇㅇ ㅂㄹㄱ ㅎㄲ ㅅㄹㅈㄷ 라는 초성퀴즈 자체가, 영화 초성퀴즈 중에서는 흔한 초성퀴즈이므로 학습데이터에 포함되었을 수 있다는거임. 그래서 듣보 영화들로 추론이 가능한지를 확인한거고, o3 기준 학습 데이터셋엔 위 네가지 영화들이 들어가 있는데도 못 맞추는걸 확인한거
@ㅇㅇ o3 기준 웹검색 사용을 금지한 상황에서 네가지 영화에 대해 디테일한 내용 설명이 가능한거 확인했음
@ㅇㅇ1(220.72) 뭘 하고 싶은건질 모르겠네 인간도 모르는 영화는 초성 퀴즈로 맞출 리가 없잖아?
@ㅇㅇ o3기준 저 영화 제목들은 학습 데이터셋 안에 있다니까? 아는 영화라는걸 설명한건데 이걸 못알아듣나
@ㅇㅇ1(220.72) 그럼 넌 모르는 영화를 초성퀴즈로 맞출 수 있음?
@ㅇㅇ1(220.72) 그런 논리면 난 하나도 못맞혔는데 그럼 난 뭐냐 애초에 추론이라는게 이미 알고 있는걸 기반으로 하는건데 좆도 모르는 씹 마이너 영화 들고와서 "이거 못맞혔으니까 LLM은 지능없어!" 이지랄하면서 존나 징징대노
@ㅇㅇ o3는 저 영화를 안다니까? 왜 자꾸 모르는 영화를 맞추는 상황을 가정하는거임. 웹검색 사용을 금지한 상황에서 네가지 영화에 대해 디테일한 내용 설명이 가능한데 모르는 영화라고?
@ㅇㅇ2(175.192) 당연히 넌 못맞추겠지. 넌 저영화를 모르니까. 근데 o3는 저 영화를 안다니까? 웹검색 사용을 금지한 상황에서 네가지 영화에 대해 디테일한 내용 설명이 가능한데 모르는 영화라고?
@ㅇㅇ1(220.72) 아 이해함 난 학습한건 초성까지 학습해서 모르는걸 초성퀴즈 내야한다는건줄