최대한 줄이면
출력은 안되는 토큰으로 요약한 "생각"을 존나 강하게 속으로만 떠올린다음 그 생각수치를 원래 나왔어야할 결과랑 합쳐서 평균낸다음 평균이하를 쳐내버리니까 결과값이 훨씬 정교해졌다는 내용임
더 줄이면
출력엔 사용안하는 혼자서만 떠올리는 "생각"이라는걸 미리 하게했더니 출력값이 훨씬 정교해짐
이라고 할수있을듯
콰이어트 스타인 이유는 출력이 안되는 조용한 추론이기때문
익명(220.117)2024-03-16 00:18
아 늦었네
익명(220.117)2024-03-16 00:21
답글
상세한 요약 고마워
숙고와 비판적 사고 능력을 인공지능이 탑재한 셈이네.. 놀랍다
익명(124.57)2024-03-16 00:24
답글
떡상이라 부르기엔 문제가 있음
이걸 테스트한 모델 자체가 mistral 7b라 약간 성능이 딸리는 모델임 원래 추론 결과가 딸리는 모델이었는데 그게 10%정도 성능이 상승한것
이정도 모델에선 약간만 개선해도 성능향상이 많은 일이 많은데다가 큰 모델과 작은 모델은 접근 방식이 많이 다름
그래서 무조건 이걸 적용하면 모든 모델이 다 성능이 올라간다! 라고는 할수없음
작은 모델들은 트레이닝을 더 많이 시켜서 모델 크기가 커지는 것만으로 원래 상당히 성능이 올라감
그래도 결과값 정확도가 꽤 많이 상승하는걸 알수있기때문에 여기저기서 테스트할 여지가 있음
내가 이해한대로면 그래도 의미가 있는 연구이고
후속 연구가 중요한 연구인듯
익명(220.117)2024-03-16 00:32
답글
거기다가 이 생각이란게 꽤 연산량이 많아보이는 작업이라 작은 모델을 강력한 컴퓨터로 돌릴때 더 의미가 있을거같음
익명(220.117)2024-03-16 00:33
해당 댓글은 삭제되었습니다.
해당 댓글은 삭제되었습니다.2026-08-04 01:36
답글
COT가 뭔지 중학생이 알아들을 수 있을 정도로 설명해줘
익명(124.57)2024-03-16 00:29
답글
이건 COT랑 또 좀 다른게 생각을 출력하지 않고 메타토큰이라는 방식으로 메모리에 올려둔다음 생각이 쓸모있었는지 아닌지를 재판단해서 버릴 생각을 버리고 좋은 생각만 남김 연산은 존나 비싼게 맞는듯
익명(220.117)2024-03-16 00:35
답글
고마워 gpt 이제 들어가
익명(124.57)2024-03-16 00:41
답글
추론을 한 결과를 메모리에만 올린다음 평균값 내서 낮은 평균을 버리는거니까 COT처럼 명시적으로 출력하는거랑 좀 다르다고 생각했는데
암튼 네말이 맞음
익명(220.117)2024-03-16 00:44
@ㅇㅇ(220.117) 그건 크게 상관이 없다고 봐. 기계가 참조한다는게 중요한거라서. 메모리에 올려놓고 쓰던, 시퀀스 뒤에 생각을 붙여놓고 그 시퀀스 토대로 다시 LM 돌려서 재추론하던 아이디어 자체는 똑같다고 생각함.
너한테 인정받아봐야 소용 없으니까 넌 확정이네만 달라고
"불합격"
한줄요약 ㅆㅅㅌㅊ
머가리 좋아짐
조금 더 자세하게 설명
1줄요약 : 말하기전에 생각하고 말하니까 성능 떡상했음
"합격"
최대한 줄이면 출력은 안되는 토큰으로 요약한 "생각"을 존나 강하게 속으로만 떠올린다음 그 생각수치를 원래 나왔어야할 결과랑 합쳐서 평균낸다음 평균이하를 쳐내버리니까 결과값이 훨씬 정교해졌다는 내용임 더 줄이면 출력엔 사용안하는 혼자서만 떠올리는 "생각"이라는걸 미리 하게했더니 출력값이 훨씬 정교해짐 이라고 할수있을듯 콰이어트 스타인 이유는 출력이 안되는 조용한 추론이기때문
아 늦었네
상세한 요약 고마워 숙고와 비판적 사고 능력을 인공지능이 탑재한 셈이네.. 놀랍다
떡상이라 부르기엔 문제가 있음 이걸 테스트한 모델 자체가 mistral 7b라 약간 성능이 딸리는 모델임 원래 추론 결과가 딸리는 모델이었는데 그게 10%정도 성능이 상승한것 이정도 모델에선 약간만 개선해도 성능향상이 많은 일이 많은데다가 큰 모델과 작은 모델은 접근 방식이 많이 다름 그래서 무조건 이걸 적용하면 모든 모델이 다 성능이 올라간다! 라고는 할수없음 작은 모델들은 트레이닝을 더 많이 시켜서 모델 크기가 커지는 것만으로 원래 상당히 성능이 올라감 그래도 결과값 정확도가 꽤 많이 상승하는걸 알수있기때문에 여기저기서 테스트할 여지가 있음 내가 이해한대로면 그래도 의미가 있는 연구이고 후속 연구가 중요한 연구인듯
거기다가 이 생각이란게 꽤 연산량이 많아보이는 작업이라 작은 모델을 강력한 컴퓨터로 돌릴때 더 의미가 있을거같음
해당 댓글은 삭제되었습니다.
COT가 뭔지 중학생이 알아들을 수 있을 정도로 설명해줘
이건 COT랑 또 좀 다른게 생각을 출력하지 않고 메타토큰이라는 방식으로 메모리에 올려둔다음 생각이 쓸모있었는지 아닌지를 재판단해서 버릴 생각을 버리고 좋은 생각만 남김 연산은 존나 비싼게 맞는듯
고마워 gpt 이제 들어가
추론을 한 결과를 메모리에만 올린다음 평균값 내서 낮은 평균을 버리는거니까 COT처럼 명시적으로 출력하는거랑 좀 다르다고 생각했는데 암튼 네말이 맞음
@ㅇㅇ(220.117) 그건 크게 상관이 없다고 봐. 기계가 참조한다는게 중요한거라서. 메모리에 올려놓고 쓰던, 시퀀스 뒤에 생각을 붙여놓고 그 시퀀스 토대로 다시 LM 돌려서 재추론하던 아이디어 자체는 똑같다고 생각함.
하긴