리눅스 쉘에서

./pgimgcrwal.py 첫글번호 마지막글번호

이렇게 치면 해당 범위 글들에 올라온 짤방들 내려받는 스크립트인데


굉장히 치명적인 약점이 있어서 질문 좀..


갤러리 html 소스를 뜯어보니까 이미지에 관련된 링크가 두군데 나오더라고


첫번째는 본문에 img 태그로 들어간 곳

두번째는 본문 하단 파일첨부란에 파일명 글자에 링크걸어놓은 곳


그런데 첫번째는 urlopen()으로 정상적으로 받아지는데

두번째는 리다이렉션이 걸려있는지 안 받아지더라고

그런데 파일이름은 두번째에서만 html 소스에 직접 나와있고..


그래서 일단 파일은 본문 링크에서 얻고

파일명은 첨부파일란에서 얻은 다음

그걸 조합해서 파일로 출력했는데...


문제는 본문 이미지 순서랑 파일첨부란 이미지 순서랑 같다는 보장이 없잖아?

심지어 둘간에 이미지 개수가 같다는 보장도 없지.

일단 파일 첨부해놓고 에디터 상에서 파일 위치를 바꾸거나 삭제할 수도 있을테니..


그래서 해결하고 싶은 점이 아래 두가지야.


1. url 주소만으로 서버상에 있는 파일의 이름을 알아낸다.

(웹브라우저에서 다른 이름으로 저장하면 이름이 뜨듯이)

2. 리다이렉션이 걸려 있는 첨부파일란의 주소를 이용해 어떻게든 정상적으로 파일을 다운해낸다.


일단 1번을 해결하는게 제일 깔끔해질 것 같은데 검색해봐도 잘 모르겠다.

http로 받을 때 헤더에 파일이름 정보가 있다니 뭐니 하는 얘기가 나오는데 그걸 어떻게 찾아내는지 모르겠음 ㅠㅠ

http 고수님들, 어떤 언어로든 짤방 크롤러 만들어본 분들 해결책 좀 부탁....................................


아 그리고 설정한 번호 범위 안에 글이 없을 때의 처리를 아주 치졸하게 해놨는데 좋은 방법 없나?

글 쓰다 보니 갑자기 생각났는데 try, except로 하면 되려나.