https://youtu.be/Sq1QZB5baNw?si=gU0Tp00f3N8Op0Qk&t=51
Figure Status Update - OpenAI Speech-to-Speech ReasoningFigure Status Update - OpenAI Speech-to-Speech Reasoningyoutu.be여기서
"그래서 제가 그 사과를 드렸습니다. 왜냐하면 그게 유일한, 어... 먹을 수 있는 음식이기 때문입니다. 테이블 위에 있는 것 중 말입니다."
이 '어...' 부분을 스피커로 출력하는 동안 언어모델 내부에서는 Quiet-Star와 같은 메타토큰(생각)을 따로 메모리 내에서 출력하고 있었다....?
Quiet-Star에서는 '생각 시작'과 '생각 중단'이 있고, 생각이 필요한 부분 외에는 그냥 일반 기존 토큰 출력 방식으로 하다가
기존 학습 과정에서 터득한 노하우로 '생각이 필요할 것 같은 부분'에서 '생각 시작'을 하고 메타토큰을 출력한 후 실제 다음 토큰을 예측해서 출력한다며..
이게 OAI에서 사용하는 Q-Star 알고리즘과 흡사하거나 같다면...
저 이번 피규어 영상에서 00:51 부근에서 '어...' 하고 멈추고 나서 자기 자신이 왜 그 사과를 건넬 수밖에 없었는지를 메타토큰으로서 생각하고 있었던 거 아니냐...?
미쳤다!!!
끝났다. 얘들아 지금까지 참 고생 많았다... ㅠㅠㅠㅜ
무무무무머무머무머무멋?????
진짜 그런거면 개소름
근데 요즘 TTS 모델들이 text 읽을 때 '어...' '음...' 이런 취임새를 넣음.
이거라고 생각하는 사람이 많더라
응...생각하는 걸수도 있겠지만, 일단 생각하는 걸 openAI에서 굳이 '어...' '음...' 이렇게 오디오 출력하도록 했다...는 가정도 해야 해서. 그것보단, 기존 TTS 모델들처럼 추임새 넣는 거라고 생각하는 게 일반적이지 않나..... GPT4 앱으로 음성 대화만 해도 자주 '어...' '음...' 이럼. 물론 아닐수도 있겠지만.
나도 그거라고 생각했었는데 메타토큰 이거 출력하는 동안에 시간이 좀 걸릴 텐데 그 동안 사용자한테 봇이 현재 생각 중인지를 알려주기 위해서 어... 와 같은 추임새를 넣을 수도 있겠단 생각이 들어서 소름 돋음
나도 이거같은데 사람이 말하는 것처럼 느껴지게끔 해놓은듯 - dc App
실제로 저것과 방법은 다르지만 비슷할지도 모르겠다
게임오바
지금 챗gpt 음성대화도 하다보면 한번씩 어.. 음... 함
그런거면 재밌겠지만 아직 모르지 ㅋㅋ
아모른직다
확정이네.
하.. 앙...
걍 이건 개인적으로 사람처럼 말하는 느낌 나게 + 여유시간 벌 수 있게 해둔거라 생각함 GPT5나 좀 내놓지 ㅜ
이건 그냥 자연스러워 보일라고 그런거같은데
싹 다 가속시켜
걍 기존 스피치 투 스피치 영향일 수도 있지만 Quiet-Star 이용한다 치면 생각 토큰 시간 동안 걍 암말 없는 건 좀 부자연스러우니 삽입했을 수도 있어서 아모른직다 !!!