성능상으로 보면 컴퓨팅 용량 증가긴 한데 하드웨어 인프라에서 필연적인 병목이 나서 힘듬
물리적 단계로 최대한 좁혀둔게 데이터센터인게 개인 컴퓨팅이랑 유무선 상으로 데이터 왔다갔다하는게 성능을 작살냄
음메엥(lightboxer)2024-12-21 14:49
답글
ㄷㄷ
공부는머리(a1530gsm)2024-12-21 14:49
지금도 GPU 클러스터에서 대역폭 문제로 호퍼니 블랙웰이니 다 이 대역폭 개선하려고 생쑈하고있음. 블랙웰도 2GPU를 아예 보드 하나에 때려박는 식으로 근데 개인 컴퓨터를 그리드 자원으로 쓴다? 연결된건 아무리 빨라도 대다수 100mbps따리 회선을? 걍 의미없는 상상임
익명(illililli)2024-12-21 14:50
답글
그게 아니라 개인이 질문하면 그 연산을 개인 컴퓨터에서 하는거지
공부는머리(a1530gsm)2024-12-21 14:52
답글
그리드 말고
공부는머리(a1530gsm)2024-12-21 14:52
답글
그리고 좋은 데이터는 수집
공부는머리(a1530gsm)2024-12-21 14:52
답글
그러니까 그 질문을 받아주려면 LLM이 떠있어야함. 4090으로도 라마3 8B도 간신히 돌아가는 수준이다. 이것도 간단한 한문장짜리 답변에 2초이상 걸림. gpt4o랑 비슷한 수준의 모델을 띄우려면 라마3 405b 정도가 필요한데 최소 4090 50장은 필요함. 이걸 개인컴퓨터로 묶는다? 그러면 각 가정의 개인컴퓨터를 가상의 클러스터로 묶고 클러스터 내부에서 들어온 프롬프트를 연산해줘야하는데, 통신이 너무 느려서 수천배는 느려질듯
익명(illililli)2024-12-21 14:55
답글
개인이 질문하는거 개인 컴퓨터에서 독자적으로 연산하는데 4090 50장이 필요하다고?
공부는머리(a1530gsm)2024-12-21 14:57
답글
그니까 내가 말하고 싶은건 개인 컴퓨터가 성능이 좋은면 답변이 더 빨리 달릴거고 성능이 낮으면 느리거나 클라우드 자원을 사용하도록 설정 체크가 가능하게 하느거지
공부는머리(a1530gsm)2024-12-21 14:58
답글
그니까 모든 사람이 자원을 나눠서 쓰는게 아니라 개인은 개인만
공부는머리(a1530gsm)2024-12-21 14:59
답글
ㅇㅇ gpt4o를 너무 우습게 보는거 아님? 그게 개인 컴퓨터로 진심 돌아간다고 생각함? 파라미터개수 8b짜리 하나 띄우는것도 float16으로 쳐내야 간신히 4090에서 올라감. 심지어 그것도 모델 전체를 쓸수있는것도 아님. 그렇다고 그게 의미 있는 정도로 빠르냐? 이것도 아니다. 조금만 문장 길어져도 5초 10초 늘어남.
익명(illililli)2024-12-21 15:03
답글
gpt4o와 유사하다고 주장하는 라마3의 405b는 8b보다 최소(진짜 최소임) 50배는 더 연산능력이 필요하다고 했고 국내 연구소급 따리에서도 70b나 띄워보자라는게 현실임
익명(illililli)2024-12-21 15:05
답글
그런거냐? 지리노
공부는머리(a1530gsm)2024-12-21 15:05
4090으로qwq 32b모델정도는 돌립니다. llama 쪽은 큰게 70b라서 돌리기어렵지만 8b수준은 작아서 쉽게 돌립니다. 20b 크기정도를 안 만들더라구요. - dc App
ㅇㅇ?
병목이 ㅈㄴ 심해서 오히려 역효과남
챗지피티는 도움된다던데
o3한테 물어보면 제대로 대답해줌
ㅇㅇ
Seti 생각하나본데 네트워크 속도 때문에 병목 생겨서 안됨..
추론속도 때문에 속 터질걸?? 사용자 컴퓨터 자원으로 추론하는건 멋진 아이디어지만..
성능상으로 보면 컴퓨팅 용량 증가긴 한데 하드웨어 인프라에서 필연적인 병목이 나서 힘듬 물리적 단계로 최대한 좁혀둔게 데이터센터인게 개인 컴퓨팅이랑 유무선 상으로 데이터 왔다갔다하는게 성능을 작살냄
ㄷㄷ
지금도 GPU 클러스터에서 대역폭 문제로 호퍼니 블랙웰이니 다 이 대역폭 개선하려고 생쑈하고있음. 블랙웰도 2GPU를 아예 보드 하나에 때려박는 식으로 근데 개인 컴퓨터를 그리드 자원으로 쓴다? 연결된건 아무리 빨라도 대다수 100mbps따리 회선을? 걍 의미없는 상상임
그게 아니라 개인이 질문하면 그 연산을 개인 컴퓨터에서 하는거지
그리드 말고
그리고 좋은 데이터는 수집
그러니까 그 질문을 받아주려면 LLM이 떠있어야함. 4090으로도 라마3 8B도 간신히 돌아가는 수준이다. 이것도 간단한 한문장짜리 답변에 2초이상 걸림. gpt4o랑 비슷한 수준의 모델을 띄우려면 라마3 405b 정도가 필요한데 최소 4090 50장은 필요함. 이걸 개인컴퓨터로 묶는다? 그러면 각 가정의 개인컴퓨터를 가상의 클러스터로 묶고 클러스터 내부에서 들어온 프롬프트를 연산해줘야하는데, 통신이 너무 느려서 수천배는 느려질듯
개인이 질문하는거 개인 컴퓨터에서 독자적으로 연산하는데 4090 50장이 필요하다고?
그니까 내가 말하고 싶은건 개인 컴퓨터가 성능이 좋은면 답변이 더 빨리 달릴거고 성능이 낮으면 느리거나 클라우드 자원을 사용하도록 설정 체크가 가능하게 하느거지
그니까 모든 사람이 자원을 나눠서 쓰는게 아니라 개인은 개인만
ㅇㅇ gpt4o를 너무 우습게 보는거 아님? 그게 개인 컴퓨터로 진심 돌아간다고 생각함? 파라미터개수 8b짜리 하나 띄우는것도 float16으로 쳐내야 간신히 4090에서 올라감. 심지어 그것도 모델 전체를 쓸수있는것도 아님. 그렇다고 그게 의미 있는 정도로 빠르냐? 이것도 아니다. 조금만 문장 길어져도 5초 10초 늘어남.
gpt4o와 유사하다고 주장하는 라마3의 405b는 8b보다 최소(진짜 최소임) 50배는 더 연산능력이 필요하다고 했고 국내 연구소급 따리에서도 70b나 띄워보자라는게 현실임
그런거냐? 지리노
4090으로qwq 32b모델정도는 돌립니다. llama 쪽은 큰게 70b라서 돌리기어렵지만 8b수준은 작아서 쉽게 돌립니다. 20b 크기정도를 안 만들더라구요. - dc App