이전에 grok4랑 o3한테 물어본적 있는 논문 아이디어 및 연구제안 질문을 해봤음


1. grok4가 제안 -> o3가 반박


https://chatgpt.com/share/686f8fa0-1d50-8008-ab5a-ab8249a7388d


 

ChatGPT - Catastrophic Forgetting and UnlearningShared via ChatGPTchatgpt.com


2. o3가 제안 -> grok4가 반박


o3가 제안한 내용


https://chatgpt.com/s/t_686f90541fcc81919ba4fbdbe7e192d5


grok4에게 반박하라고 시킨 다음 api로 응답을 받음 -> 그 다음 4.1한테 마크다운에 맞게 재작성하라고 시킴


https://chatgpt.com/share/686f9029-933c-8008-ac81-0a7cc73f1a61


 

ChatGPT - Critique and Research ProposalShared via ChatGPTchatgpt.com



아래는 gpt5한테 물어봤을때 받은 답변


https://chatgpt.com/s/t_68955c954c2c8191b899d82e21250c77


요약하자면, 학습하기 전의 파라미터와 학습한 후의 파라미터를 사용해서 추론 확률분포 차이를 regularizer로 두라는건데

이건 진짜 grok4가 제안한 '이전에 잘 풀수 있었던 task들에 대한 성능 평균'을 regularizer로 두라는 아이디어만도 못함

왜냐하면 그냥 l2 regularizer 수준마냥 말 그대로 '파라미터가 너무 업데이트 되지 않게' 규제하는 방법과 똑같기 때문

말은 휘황찬란하게 했는데 본질은 다르지 않음


추가로 이전에 ai 퀴즈로 평가해보려고 했던건데


https://chatgpt.com/s/t_68955d6bac548191af1ea7b183face64


놀랍게도 o3가 제시한 질문보다도 더 어처구니없는 질문을 제시함

분류기 학습 시 정확도가 갑자기 올라가면 무슨 일이 발생한건지 추측해보라는 질문...

게다가 여기에 대한 답변은 '학습 데이터가 검증 데이터에 섞여서 그렇다'...

내생각엔 진짜 말 그대로 4o에서 반발짝 오른건 맞는데

o1, o3, o4mini보다는 멍청한게 맞는거같음