웹 페이지의 모든 외부 링크를 추출하여 파일로 저장하려면 어떻게합니까?


11

웹 페이지의 모든 외부 링크를 추출하여 파일로 저장하려면 어떻게합니까?

명령 줄 도구가 있다면 좋을 것입니다.

답변:


18

lynxawk 도구가 필요 합니다.

$ lynx -dump http://www.google.com.br | awk '/http/{print $2}' > links.txt

번호 매기기 줄이 필요한 경우 nl 명령을 사용 하여 다음을 시도하십시오.

$ lynx -dump http://www.google.com.br | awk '/http/{print $2}' | nl > links.txt

나는이 상대 URL에 대한 작동합니다 생각하지 않는다
스리 Sarnobat에게

8

lelton의 답변이 개선되었습니다 : lynx가 유용한 옵션을 얻는 데 전혀 신경 쓸 필요가 없습니다.

lynx -listonly -nonumbers -dump http://www.google.com.br

당신이 숫자를 원한다면

lynx -listonly -dump http://www.google.com.br

0
  1. Beautiful Soup 을 사용 하여 해당 웹 페이지를 검색하십시오.
  2. 도메인을 가리 키지 않는 모든 URL을 찾으려면 awk를 사용하십시오.

화면 스크래핑 기술보다 Beautiful Soup을 추천합니다.


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.