오전부터 이거 하나만 꽂혀서 갤이 계속 타는데 이쯤에서 정리하겠습니다. LLM이 세상을 인식하는 방식은 인간과는 다릅니다. LLM 본연의 지능과는 상관없는 단순 토크나이저 문제로 (효율성을 포기하고 각각의 문자 단위로 토큰을 구분만 해도 바로 해결될), 이를 댓글에서 알려주어도 모른척 하며 분탕 목적으로 나아가는 어그로는 제재 대상입니다.
ㄹㅇ ㅋㅋ 의도적으로 떡밥굴리는게 투명하게 보임
타 직업 비하도 졸라게 많구만 그것도 정리좀
혹시 '시발럼아' 한마디 했다고 나 30일 차단한게 sama님이세요?
아닙니다.
욕좀 하지마셈. 징징거리지도 말고 - dc App
strawberry r글자수세는것도 비슷한 원리임?
네
뭔말인지 모르겠어요 선생님
글자 그대로 인식하는 게 아니라 딸기는 2322332 사과는 1238281 이런 식으로 단어를 숫자를 붙여 인식하는 거야 그래야 컴퓨터가 계산이 빨라
Tokenizer로 텍스트릏 벡터화하여 실제 Raw 데이터값이 뭔지 몰라 생기는 문제, Subword segmenation으로 어느정도 해결가능
GOAT
억떡은 그냥 바로 컷해버리네 ㄷㄷ
지금 주딱 그때 물려받은 프린스 맞음? 아님 그새 또 바뀐거임? - dc App
프린스 맞아요 그냥 닉변한거
아하 파이팅!
인간이랑 똑같아야 성공 아님?
뭘 성공해요?
흠 잘모르긴 한데 인식하는 방식이 달라도 결과값은 인간과 동일하게 나와야는거 아님? 그리고 그 구분을 그정도도 못하다는건 아직 문제인듯 분탕인가요 이게?
차후 개선될 문제일뿐이지 당장 해결하자고 토크나이저를 안써야한다는건 말이 안되는거지. 대안이 있음? 이미 알려진 문제점까지 인지한 이슈가지고 물고 늘어지지말잔거지
무슨 연유로 파딱님이 끌올하셨는진 모르겠지만 숫자 떡밥으로 억지 비관론을 내세우는 것은 제재 대상입니다.
@sama 토크나이저 문제로 올라와서 차단은 안하고 걍 글 끌올하고 삭제처리만 대신했습니다
그리고 추론 패러다임 오면서 이 한계도 넘어서고 있고..
섹스함?