이전에 grok4랑 o3한테 물어본적 있는 논문 아이디어 및 연구제안 질문을 해봤음
1. grok4가 제안 -> o3가 반박
https://chatgpt.com/share/686f8fa0-1d50-8008-ab5a-ab8249a7388d
ChatGPT - Catastrophic Forgetting and UnlearningShared via ChatGPTchatgpt.com
2. o3가 제안 -> grok4가 반박
o3가 제안한 내용
https://chatgpt.com/s/t_686f90541fcc81919ba4fbdbe7e192d5
grok4에게 반박하라고 시킨 다음 api로 응답을 받음 -> 그 다음 4.1한테 마크다운에 맞게 재작성하라고 시킴
https://chatgpt.com/share/686f9029-933c-8008-ac81-0a7cc73f1a61
ChatGPT - Critique and Research ProposalShared via ChatGPTchatgpt.com
아래는 gpt5한테 물어봤을때 받은 답변
https://chatgpt.com/s/t_68955c954c2c8191b899d82e21250c77
요약하자면, 학습하기 전의 파라미터와 학습한 후의 파라미터를 사용해서 추론 확률분포 차이를 regularizer로 두라는건데
이건 진짜 grok4가 제안한 '이전에 잘 풀수 있었던 task들에 대한 성능 평균'을 regularizer로 두라는 아이디어만도 못함
왜냐하면 그냥 l2 regularizer 수준마냥 말 그대로 '파라미터가 너무 업데이트 되지 않게' 규제하는 방법과 똑같기 때문
말은 휘황찬란하게 했는데 본질은 다르지 않음
추가로 이전에 ai 퀴즈로 평가해보려고 했던건데
https://chatgpt.com/s/t_68955d6bac548191af1ea7b183face64
놀랍게도 o3가 제시한 질문보다도 더 어처구니없는 질문을 제시함
분류기 학습 시 정확도가 갑자기 올라가면 무슨 일이 발생한건지 추측해보라는 질문...
게다가 여기에 대한 답변은 '학습 데이터가 검증 데이터에 섞여서 그렇다'...
내생각엔 진짜 말 그대로 4o에서 반발짝 오른건 맞는데
o1, o3, o4mini보다는 멍청한게 맞는거같음
thinking은?
다 thinking 켜고 한거임
@약팔이아님 5 thinking이 4o보단 낫지만 o1 이래 추론 모델보다 멍청하다고? 흐으음....
@ㅇㅇ1(121.132) 나도 황당함