신문기사 제목을 몇 자까지 줄일 수 있을까요?
네이버 뉴스에서 최근 레이아웃이 바뀌었는데 기사를 줄이는 모습이 놀랍습니다.
인기검색어 일간 급상승 검색어
최장이 레알마드리드디나모자그... 11자
핫 토픽 키워드
1 일본식 이름 짓기 NEW
2 헐크 개미 탄생
3 김경진 집 공개 NEW
4 남극해 한국어선 화재 NEW
5 두산 이규환 사망
6 학교폭력 신고전화 ... NEW
7 주지훈 하차 이유
8 아이유 감딸기 빙의 NEW
9 박희태 전 비서관 ... NEW
10 엄정화 최진실 그리움 NEW
11자
가장 많이 본 뉴스
"두산 경쟁자, 넥센 쪽.."
최 희 "여자 아나운서라.."
최희섭, 넥센에 얼마나 도움...
긱스 동생 "형은 벌레"
태국 기자 "한국전이 1승 기...
최희섭 마음고생 1년
최희 아나운서 폭행시비
투수 '삼성 1군' 하늘의 별...
16글자인 듯
첫 화면의 뉴스캐스트
의장직을 던질 사나이 박희태 검사가 그립다 데일리안
"아이패드3, 3월 출시…아이폰5 2분기에나" 한국경제TV
'北공기부양정 킬러' 강력한 헬기를… 서울경제
Looming S&P downgrades hits euro zone 로이터
김문수에 “경기도민 김미화입니다…”경향신문
에드워드 권은 ‘짝퉁 셰프’다한겨레
추위 떨던 고양이, 車밑에 숨었다가 ‘충격’파이낸셜뉴스
모두가 노스페이스를 입을 수는 없다 미디어오늘
IPhone Sales Curtailed in China WSJ Asia
한글로 25글자입니다.
중국어는 더 적겠죠.
참고: 책은 얇아야한다.
http://kldp.org/node/102982
Estimating and Comparing Entropy across Written Natural Languages
Using PPM Compression Frederic H. Behr, Jr.* Victoria Fossum† Michael
Mitzenmacher
http://www.liafa.jussieu.fr/~dxiao/docs/entropy.pdf
논문입니다.
언어별로 성경 압축해서 비교한 겁니다.
참고하시면 좋겠네요.
결론은 PPMZ알고리듬으로 성경을 압축하면
영 1
서 0.992
불 0.991
중 0.941
한 0.970
아랍 1.09
일 1.206
러 0.997
BZIP2 성경 압축시
영 1
서 1.006
불 1.026
중 0.899
한 0.941
아랍 1.090
일 1.170
러 1.002
gzip으로 성경 압축시
영 1
서 0.994
불 1.018
중 0.780
한 0.907
아랍 1.116
일 1.162
러 0.946
입니다.
한국어가 중국어보다 배우기도 쉬운데 압축률도 2위니까 괜찮은 편이라고 봐야 하는 건가요?
한글의 형태적 특성을 이용한 한글 문서 압축 기법에 관한 연구
http://academic.naver.com/view.nhn?doc_id=10588717&dir_id=0&field=0&gk_a...
한국어의 특성에 맞는 압축 알고리듬도 연구가 되어 있겠죠.
각 언어별로 최소 압축 가능한 알고리듬으로도 벤치마킹해본 논문좀 누가 써주세요.
아니면 요즘 프로그래밍 언어 벤치마킹 게임 사이트처럼 공개적으로 누구나 참여해서 각 자연언어의 효율을 비교하는 장을 마련해보면 재밌을 겁니다.
한글의 형태적 특성을 이용한 한글 문서 압축 기법에 관한 연구
http://dspace.inha.ac.kr/bitstream?item_id=8867&filePath=/pdfupload/8867...
참고:
트위터 140자 공간에 이미지 구겨넣기 경진대회
http://kldp.org/node/135442
추천 드립니다.
갑골문자 시절엔 합문이라고 해서 여러 글자를 하나의 글자처럼 쓰기도 했음. 이런거까지 이용하면 한자가 유리하긴 할 듯.
참고로 작년엔가 요미코체처럼 된소리나 복모음을 보통소리나 단모음으로 바꿔서 압축하고 맞춤법 검사기로 복호화하는 아이디어를 프갤과 트위터 등에 적은 적이 있습니다.
요미고는 상상바가 먹고 시퍼요를 요미코는 쌍쌍바가 먹고 싶어요로 복호화하는 겁니다.
요미코체는 손실압축 인코딩이 되는거죠.
요미코체는 압축은 아니구... 그냥 데미지...
복호화가 아니라 recovery ㅋㅋ
그렇게 하느니 걍 표준국어대사전 속 표제어를 중복없이 싹 단어들만 데이터화해서 단어에 고유번호 붙인 뒤 긴 단어는 그걸로 압축하는 것도 효율적일 것 같음.
ㄴ그게 허프만코딩 아닌가요?
그리고 한글 글자 중에서 잘 안 쓰는 희귀한 조합이 있기 마련인데 희귀한 조합 빼고 표준국어대사전 표재어애 있는 글자들로만 또 인덱스 매겨서 문자 저장하면 또 압축될 듯.
등장 빈도별로 적은 비트를 할당하면 허프만코딩 맞징 : )
섹스신님 실례지만 본인 맞으신가요?
응 맞앙