https://transformer-circuits.pub/2025/linebreaks/index.html
When Models Manipulate Manifolds: The Geometry of a Counting TaskWe find geometric structure underlying the mechanisms of a fundamental language model behavior.transformer-circuits.pub소넷한테 요약시켜보니 뭔가 내부에서 다차원적인 뭐시기랑 거시기를 통해서 글자수를 새서 올바른 줄바꿈을 한다거나, 아스키 아트를 이해하거나, SVG 코드를 보고 생김새를 이해한다거나 하는데, 그게 생물학적 뇌랑 유사성도 있는거 같다? 정도인거 같은데, 그래도 모르겠음
transformers circuit은 단일 스레드만 보면 이해하기 좀 어렵고, 이전 맥락이랑 어떻게 여기까지 왔나 빌드업을 좀 알아야 편함
다시 설명시켜보고 보니까 50글자 단위로 줄바꿈하는, 매우 단순해보이는 작업을 모델은 내부에서 6차원 곡선을 돌려가면서 그것들의 경계를 검출하는 짓 등을 하면서 하고 있었다는데 이거 참 쉽지 않네
manifold hypothesis가 Deep learning 근간을 하는 가설이라서 이것도 같이 물어봐
@ㅇㅇ1(218.39) 오호 이거 신기하네 ㄳㄳ
그냥 첫 두문단만 읽으면 llm의 생각을 시각화하는 공간이 어떻게 생겼는지 연구한 거 같은데
트랜스포머 서킷 이거 연구자들도 피똥싸는 데 딸깍으로 이해하려면 한참걸린다 게이야..
이게 맞네...