gemma4 시스템 prefix cache 가능한 경우라면 더 길게 써도 되지만 별로 길지도 않던데 추론 라우팅 시키고
고유 사고 토큰 뱉는 방식 대신 짭추론 시키되(여기까지는 실증 사례를 읽음. 더 빨리 끝나고 추론 없음보다 토큰 수 적고 빠른 출력)
(여기서부터 상상임) beam을 greedy하지 못하게 해서 한번 정도는 wait 뱉도록 하면
걍 프롬프팅만으로도 성능 향상 가능할 거 같은데
막상 내 서비스에선 아예 생각 끄고 서빙해서 쓸 데가 없네
[일반] 똑똑하면서 더 빨리 생각 끝내기
익명(112.144)
2026-04-14 19:48
추천 0
댓글 6
다른 게시글
-
브록만 컴퓨트 기반 경제 글 이렇게 읽히네[일반] 익명(221.142) | 04.14추천 1
-
메타, 저커버그 대신할 'AI 페르소나' 개발 중 [4][📪정보] 회색(counsel8318) | 04.14추천 5
-
좆소 다니는데 평택으로 갈까 심각하게 고민중 [16][일반] 서벌먕먕이(kwo1256) | 04.14추천 1
-
님들 대학생인데 유료결제 지피티 vs 젬미니 vs 클로드 [6][일반] 익명(110.14) | 04.14추천 0
-
탈희소성 달성이 가능한이유 [4][일반] ㅁㄴㄹㄹ(sotruvaak) | 04.14추천 0
-
2026 AGI [4][일반] 익명(halt3917) | 04.14추천 1
-
이번주 안에 감자 안나오면 얀르쿤 지지함 [2][일반] 익명(zmfhtmzhem5) | 04.14추천 0
-
과기부 이거 UBI 일종으로 보는 사람들이 있네 [23][일반] Hbtt(needle2148) | 04.14추천 10
-
단일 유닛으로 다수 함수 계산하는건 이미 있음 [2][일반] capybara(ready0681) | 04.14추천 0
-
알트먼 화염병 공격 용의자, 타 AI 기업 CEO도 목표로 삼아 [36][📪정보] 회색(counsel8318) | 04.14추천 34
speculative decoding, dflash 논문을 읽어보시면 좋을거같아요 wait / reasoning token의 경우, s1 (simple scaling)논문이 관련되어있어요
추측 디코딩은 31b + e2b 코딩/작문 각 50%/ ?% 빠르다는 건 봤음 근데 26b a4b는 이미 충분히 가벼운 편이라고 생각해서. 그리고 gemma4의 경우 '직접 돌리는 것'이 상당히 손해라고 생각함 API가 워낙 싸게 나오고 있어서. API 굴리면서 추측 디코딩을 할 수도 없지만, 짭추론이 분명히 유리한 지점이 있어서. 단점도 있긴한데, 멀티턴에선 짭추론이 기본 템플릿 못 써서 손해긴 함
그리고 글 자체가 추측 디코딩과 아무 상관이 없는 내용임 wait을 알고 있는데 논문을 읽어볼 필요가 있는지도 의문
@글쓴 ㅇㅇ(112.144) 생각을 끄고 서빙하면 특히... dflash의 경우는 특히 도움이 될 수 있어요 아예 diffusion방식으로 훨씬 빠르게 서빙하는 방식이라
@일본에간대학원생 내 task에서는 여전히 별 의미는 없음 - 시간 줄이는 게 나한테 엄청나게 유효하지도 않고 시간 줄인만큼 돈 적게 내는 것도 아니고 근데 짭추론은 한창 이슈였던 모델 개조랑은 좀 다름 실증은 옆챈에 있으니 한번 봐봐 ㄱㄱ
@일본에간대학원생 아 다르다는 건 '실증 가능하냐' '재현 가능하냐' '여러 이슈에 직접 테스트 가능하냐' '빠른 벤치로도 체감 되냐' 얘기임