이종 시스템에 서로 다른 언어라면 좀 더 신경쓸게 많아지징 ㅇㅇ
길이문제는 간단한데, 엔디안 문제가 복잡해서 utf8이 가장 나음.
1. UTF16 인데 wchar 로 표현할수 없는 문자가 있다. 이 가정부터가 틀린거 아니야? ( 나도 이런 유니코드에 대해서는 잘 몰라서 )
2. 문자열 개수 확인하려면 바이트로 읽어들여 코드포인트 체크를 해야한다 ( 코트 포인트를 확인한다는게 결국 UTF16 포맷에 이라는 가정일꺼 같은데.. 왜..?
문자열에 서로게이트라고 이문자는 wchar두개이상 쓴다는 코드포인트가 있는데 그걸 걸러내야함. ㅇ 16이라는 가정하에서 정의되는 것
ㄴ 감사.. 그러니까 결론은 "UTF16는 4바이트로 표현 되어야될 문자가 존재한다." 인거네?
ㅇㅇ 그런거
ㄴ 아아.. 꼭 4바이트가 아니구.. "unicode 가 버젼업되어 4.0이 나왔을때에는 0x10FFFF 까지의 index가 생겼다." 라고 하네
3byte 에 코드 포인트가 있구나.. 처음 알았다.. 감솨 !
http://blog.ggaman.com/896
땡칠도사 횽 말씀대로 엔디안문제가 큰듯
오호 엔디안 문제... 문자열 처리와 관련해서는 이 게시글은 신세계군 ..ㅋㅋ
http://lgstar.tk커뮤니티 사이트 입니다 많은 이용 부탁 드립니다. - DCW
이종 시스템에 서로 다른 언어라면 좀 더 신경쓸게 많아지징 ㅇㅇ
길이문제는 간단한데, 엔디안 문제가 복잡해서 utf8이 가장 나음.
1. UTF16 인데 wchar 로 표현할수 없는 문자가 있다. 이 가정부터가 틀린거 아니야? ( 나도 이런 유니코드에 대해서는 잘 몰라서 )
2. 문자열 개수 확인하려면 바이트로 읽어들여 코드포인트 체크를 해야한다 ( 코트 포인트를 확인한다는게 결국 UTF16 포맷에 이라는 가정일꺼 같은데.. 왜..?
문자열에 서로게이트라고 이문자는 wchar두개이상 쓴다는 코드포인트가 있는데 그걸 걸러내야함. ㅇ 16이라는 가정하에서 정의되는 것
ㄴ 감사.. 그러니까 결론은 "UTF16는 4바이트로 표현 되어야될 문자가 존재한다." 인거네?
ㅇㅇ 그런거
ㄴ 아아.. 꼭 4바이트가 아니구.. "unicode 가 버젼업되어 4.0이 나왔을때에는 0x10FFFF 까지의 index가 생겼다." 라고 하네
3byte 에 코드 포인트가 있구나.. 처음 알았다.. 감솨 !
http://blog.ggaman.com/896
땡칠도사 횽 말씀대로 엔디안문제가 큰듯
오호 엔디안 문제... 문자열 처리와 관련해서는 이 게시글은 신세계군 ..ㅋㅋ
http://lgstar.tk
커뮤니티 사이트 입니다 많은 이용 부탁 드립니다. - DCW