GPT5나오는거 봐야하긴 하는데
밀집신경망 이새끼 연산비용은 비싼주제에 표현력이 너무 자유분방해서추론의 체계성, 연역성을 유도하려고 데이터를 암만 쏟아붓고 학습법으로 암만 사고과정의 바리에이션을 좁혀도 자꾸만 의도한바와 다른 엇비슷한 우회루트를 타는게 문제임
결국은 지난주쯤에 념글갔던 bert 300배효율 논문같이 신경망 자체에 트리구조를 접목시키는게 필요하다고 봄 근데 아직까지 이런논문들 여태 산더미같이 나왔는데도 실제로 거대모델에 도입해서 성과를 냈다는 얘기가 없던데 대체 뭐가 문제인걸까...
밀집신경망 이새끼 연산비용은 비싼주제에 표현력이 너무 자유분방해서추론의 체계성, 연역성을 유도하려고 데이터를 암만 쏟아붓고 학습법으로 암만 사고과정의 바리에이션을 좁혀도 자꾸만 의도한바와 다른 엇비슷한 우회루트를 타는게 문제임
결국은 지난주쯤에 념글갔던 bert 300배효율 논문같이 신경망 자체에 트리구조를 접목시키는게 필요하다고 봄 근데 아직까지 이런논문들 여태 산더미같이 나왔는데도 실제로 거대모델에 도입해서 성과를 냈다는 얘기가 없던데 대체 뭐가 문제인걸까...
scaling이 어렵겠지
좀만더 생각좀 풀어줄수있음
?
xot 좋아보이던데