STEM이라고 해야할지 말아야할지 정확히 모르겠는데
예전에 o3 나왔을 때 catastrophic forgetting, 그러니까 학습할수록 언어모델이 지식을 잊어버리는 현상에 대해서
여러 논문 아이디어를 짜깁기한 다음 아이디어를 제안하라고 한 적이 있음
그걸 이용해서 이번에 grok4 API한테 똑같은 질문을 한 다음
서로한테 해당 제안을 반박하고 더 나은 제안을 해보라고 했음
참고로 search config 켜고 한거임
1. grok4가 제안 -> o3가 반박
https://chatgpt.com/share/686f8fa0-1d50-8008-ab5a-ab8249a7388d
2. o3가 제안 -> grok4가 반박
o3가 제안한 내용
https://chatgpt.com/s/t_686f90541fcc81919ba4fbdbe7e192d5
grok4에게 반박하라고 시킨 다음 api로 응답을 받음 -> 그 다음 4.1한테 마크다운에 맞게 재작성하라고 시킴
https://chatgpt.com/share/686f9029-933c-8008-ac81-0a7cc73f1a61
내용이 너무 길고 복잡해서 정확한지 일일이 검증하기는 어렵고 (거의 한두시간은 걸릴듯)
글과 내용만 봤을때 o3가 낫다고 생각한 이유는
1. 좀 더 정확한 개념을 사용하고 레퍼런스를 더 정확히 언급하며 반박함
-> PGD-style optimization은 제안서에 적힌 것보다 훨씬 계산량을 많이 사용한다는 실제 연구를 들어 반박
2. grok4는 누구나 알법한 뭉뚱그리는 소리를 하는편임
-> 임베딩 차원에서의 클러스터링은 saliency estimation을 하기에는 정밀도가 충분하지 않다
-> 당연한 소리이지만 그럼 아직도 텍스트 임베딩 만드는건 바보라서 하나? 대안이 없어서 그렇지
3. 새로 제안한 내용은 o3가 훨씬 나음
-> grok4는 influence가 suddenly drop하는 데이터를 invert하는 학습방법을 제안함 -> 다시 읽어보니까 task data들에 대한 loss가 평균적으로 gradient update 크기에 비해 크게 낮아지지 않는지 패널티를 주는 방법을 제안한건데, 원래 제안방법보다는 낫지만 o3가 제안한게 여전히 훨씬 나음 직접적인 task performance를 측정하는거보단 task parameter간의 orthogonality가 훨씬 generlize가능한 방법임
-> o3는 여러 task data들의 cluster들의 low-rank subspace에 대한 orthogonality를 계산하는 loss를 penalty로 놓으라 함
-> grok4는 사실상 새로운 제안을 한게 아니고, o3는 LLM이 각 task가 서로 이질적임을 잊지 않아야 한다는 직관을 새로 내놓음
내 생각엔 grok4는 grok3에서 한 반발짝은 앞섰는데 그래봐야 o3보다 한체급 낮음 이걸로 stem 이겼다는건 말이 안된다 생각함
개추
채팅기록 들어가자마자 토하고 나왔다 왤케똑똑함
예전에 o3 나왔을때 한 한시간동안 공들여서 질문하고 답변받고 공부한 내용이라 아는거임 나도
머스크 벤치사기친거 걸렸노 ㅋㅋ
과적합 엔딩나면 머스크 총살
머스크가그러치머
벤치사기인가 검색능력 문제인가
공홈은 tool이나 프롬프트가 훨씬 좋을수 있으니 결과가 다르게 나올수도 있음 나는 이거 api 응답 받는데 2분 40초 걸림
이거 하나로 단정은 씹 ㅋㅋ
근데 나도 o3 pro api로 쓸때랑 공홈에서 쓸때랑 차이가 좀 있더라구. api로 쓸때 기존 논문들 마크다운으로 정리해서 요약한 부분이랑 추가 컨텍스트 제공해서 결과 얻었었는데 수식에서 논리적 비약들이 꽤 있었음. 공홈에서는 지금까지 그렇게 큰 비약 본 적은 없는듯. 그록은 어떨지 모르겠지만 공홈도 써보는게 나을거같아
나도 그렇게 생각함 공홈 쓰고싶은데 30달러를.... 쓰기는... 싫어
@약팔이아님 나도 프로 안썼으면 써봤을텐데 굳이 쓰고싶진 않더라 ㅋㅋ
아니 어디 핫바리 벤치도 아니고 usamo, hle, arc-agi 이런 데서 그록4가 2.5프로, o3 명확히 찍어눌렀는데 실사용 후기는 왜케 다 기대 이하야... 가슴이 먹먹해지네
근데 좀 더 지켜볼 필요는 있는거같어
사스가...갓 o3
적어도 local 하게는 맞는 말을 해줘야 써먹지 o3처럼 reference근거로 말하고 거기에 살만 조금 붙이는게 맞는듯 STEM에 대한 질문에 대해서는 AI가 팩트체크없이 수학적 근거없이 말하는 건 금지시켜야됨
뭔 말하는 건지 하나도 모르겠지만 일단 개추