어떻게 하는거임 도대체가 api를 받아오고 추론능력을 줄인다? 내부 시스템 추론능력을 최소화시키는 건 불가능하고 데이터넘길 때 thinking budget 같은 옵션들로 조절해서 넘기는건데 난 전부 최소화시켜도 거의 10초가 걸림. 플랫폼이 flash인걸 pro라고 적어놓진 않았을 테고 존나 궁금하네
추론이랑 인풋 컨텍도 최소화하고 스트리밍 방식으로 받아오면 그정도 체감 아닐려나?
다해봣는데 5~10초정도 걸림
아니다 인풋컨텍은 안해봤네
먼데 챗이
챗 플랫폼이 뭐냐고? 크랙
뤼틈 구글하고 파트너쉽잇을건데
있긴할텐데 그것만으론 약간 설명이 안되기도 하고.. 1인 개발 챗 플랫폼도 2초만에 출력하더라. 신기함
@ㅇㅇ 결론음 크랙이든 타 1인 개발이든 api라는거 아니야? api로해봐
api로 해보고 있는데 속도가 잘 안빨라지네 계속 알아봐야지 ㅠㅠ
ai studio 응답 생각하면 추론 budget 만 최소치로 설정하면 응답 금방 올 것 같은데
추론 토큰 128이냐 기본값인 8192인지에 따라 단순한 응답도 10초 넘게 차이나서
프리시딩 토큰 기법이라고 있습니다
혹시 구글이나 다른 곳에 관련 기술 문서가 있는지 궁금한데 혹시 공유 가능?
그게 머에요 검색해도 안나오는데
혹시 '
https://ai.google.dev/gemini-api/docs/caching?lang=python'
이거 말하는거임? 이거 말고는 딱히 구글 gemini 쪽에서 프리시딩이라고 할만한걸 모르겠는데;