Q* 알고리즘의 이름에 대한 가장 유력한 추측중 하나가
강화 학습 알고리즘인 Q-Learning 과 길찿기 알고리즘의 A* 에서 가져왔다는 것.
이번에 4o 의 예시를 보면 비언어적 표현을 이해하는 모습을 보이는데
기존의 모델과 다른 4o의 멀티-모달리티를 나타내는 부분임
호랑이 울음소리와 으르렁 이라는 단어를 연결시켜 학습시켜야 하는데 이게 필연적으로
모델의 복잡성을 늘리게 되고, 장기적으로 성능 향상을 유지하기 힘든 구조가 될 수 밖에 없음.
여기서 Q*가 나오는거임.
Q-Learning은 주어진 상태에서의 최적의 결과 값 쌍을 학습시키는 알고리즘
A*는 최단거리를 알아내는 알고리즘
MoE 방식으로 구성된 GPT의 내부 모델
이 특징을 조합해서 탄생한 Q*는 아마도 입력된 값에 따라서 내부 모델들의 노드별 최적의 연결 및 활성화 정도를 결정하는 알고리즘이라고 생각함
이러한 방식으로 모델을 형성하면 모델의 크기가 커져도 필요한 부분만을 활성화 시키기 때문에
Scale is all you need 로 대표되는 성능의 증대를 성취함과 동시에 따라붙는 비용 증가/속도 저하 문제도 해결이 가능함
그래서 GPT-4 대비 성능 상승, 속도 2배, 비용 1/2 를 모두 이룰 수 있었던 거라고 본다.
[일반] 의외로 GPT-4o가 Q* 일 수 있다고 본다.
익명(222.234)
2024-05-16 11:30
추천 1
댓글 9
다른 게시글
-
이기적 유전자랑 gpt4o번역이랑 좀 비교해보고싶네 [2][일반] 떼껄룩해적..(piracykitten) | 24.05.16추천 0
-
AGI에 너무 집착해서 그렇지 [3][일반] 익명(122.45) | 24.05.16추천 0
-
지금 gpt 나만 안되나? [3][일반] 캬르룩(dbtmdgns1595) | 24.05.16추천 0
-
4o 코딩 말고 엑셀 작업 능력도 엄청 좋아진 듯 [3][일반] mendako(symptom5559) | 24.05.16추천 0
-
새 모델 나올때마다 벤치 찔끔찔끔 오르는거 킹받네 [2][일반] 익명(110.145) | 24.05.16추천 0
-
코딩할때 클로드가 더좋은거 같은데 [1][일반] 익명(103.212) | 24.05.16추천 0
-
AI로 동인음성 대체 가능하냐 [2][일반] mendako(symptom5559) | 24.05.16추천 0
-
GPT3 탈옥해서 이상한말 하네~ 한지가 1~2년 된거같은데[일반] 익명(218.234) | 24.05.16추천 0
-
잘 모르는 사실) 4o는 음성만 낼 수 있는 게 아님 [12][일반] 익명(119.202) | 24.05.16추천 4
-
글 쓰는데 도움받을거면 클로드가 낫나? [7][일반] 익명(183.97) | 24.05.16추천 0
Q*을 썼으면 비용과 시간이 올라가지, 내려가진 않아. search가 시간이 얼마나 오래 걸리는데. ToT만 해도 몇백곱절의 시간을 잡아먹는다.
입력을 넣으면 실시간으로 Q*를 돌린다는 얘기가 아님 학습과정에 Q*가 도입되어 미리미리 만들어진 {상태 : 행동} 쌍에 의해서 돌아간다는 말임 테이블을 만드는데에는 많은 컴퓨팅 파워가 필요하겠지만 만들기만 한다면 빠른 접근이 가능함
상태-행동쌍으로 돌아가는건 Q-Table을 쓰겠다는 건데 그건 RL에서 쓰는거잖아. 그러면 빨라지겠지만 LLM에 활용하려면 우선 블랙박스부터 벗겨야 될껄? 근데 블랙박스 벗기는 작업은 실패했잖아. 구글에서도 LLM에 RL접목시키는게 답이라고 해놓곤 그걸로 gpt4도 못이기고 막혔어. Q*보단 멀티 토큰 아웃풋이 맞겠지.
물론 당연히 진짜 Q-Learning을 그대로 박아서 쓰진 않았을듯 Q* 로 인한 결과가 Q-Learning과 A*와 공통점이 있었기에 이름을 붙였다고 생각함
아니야..
추측임
근데 큐스타는 수학문제 해결 능력이 좋다는 이야기들이 있던건데, 4o의 수학문제 해결은 확연하게 달라지진 않은 것 같고. SORA 학습 루머에서, text -> 달리 -> image -> 언리얼 -> video 했다는 얘기가 있었거든. 이러면 영상에 대한 명확한 라벨링이 가능함. 이걸, openAI에 있다는 오디오생성모델. 쥬크박스도 비슷한 방식으로 쓰면, text -> 쥬크박스 -> audio 이게 되면 역시 소리에도 명확한 라벨링이 가능함. 그러면 네가 말한 호랑이 울음소리랑, 으르렁이 자연스럽게 라벨링 되면서 난이도가 낮아질 것 같음. 그리고, 알트만이 최근 큐스타 질문을 아예 회피했는데, 4o에 쓸 정도인데 굳이 회피까지 할 정도인가. 아주 구린거거나, 비밀병기라서 숨기는 거 아닐까 싶음.
물론, 나도 몰루겠당. 어떻게 텍스트랑 오디오랑 이미지를 한번에 학습 시키지.
q*아직 해독 못했다고 말함