성장, 그리고 노력

부족하더라도 어제보다 더 잘해지자. 노력은 절대 배신하지 않는다.

Crawling 4

[HTTP] 웹 로봇 1

웹 로봇은 사람과의 상호작용 없이 연속된 웹 트랜잭션들을 자동으로 수행하는 소프트웨어 프로그램이다. 그리고 각각의 방식에 따라 '크롤러', '스파이더', '웜', '봇' 등 여러 가지 이름으로 불린다. 크롤러와 크롤링 웹 크롤러는 먼저 웹페이지를 한 개 가져오고, 그 다음 페이지가 가리키는 모든 웹페이지를 가져오고 하는 이 과정을 재귀적으로 반복하는 방식으로 웹을 순회하는 로봇이다. 이렇게 웹 링크를 재귀적으로 따라가는 로봇을 크롤러 혹은 스파이더라고 부르는데, HTML 하이퍼링크들로 만들어진 웹을 따라 "기어 다니기(crawl)" 때문이다. 인터넷 검색엔진은 웹을 돌아다니면서 그들이 만나는 모든 문서를 끌어오기 위해 크롤러를 사용한다. 이 문서들은 나중에 처리되어 검색 가능한 데이터베이스로 만들어지는데..

네트워크 2020.01.12

[JAVA] 크롤링과 엑셀을 이용한 도서 관리 프로그램

소개글 자바를 배우며 두번째로 만들어본 도서 관리 프로그램입니다. 이 프로젝트에는 명확한 특징 두 가지가 있습니다. 첫번째 특징은 "엑셀의 데이터 베이스화"입니다. 이 프로그램 구현 당시에는 데이터 베이스를 배우지 않았습니다. 하지만, 프로그램을 구현하다보니, 가지게된 문제점은 바로 "프로그램이 종료되면 모든게 리셋(reset)"된다는 점이었습니다. 물론 강사님은 나중에 데이터베이스를 배우면 해결된다고 하셨지만, 저는 여기서 문득 별난(?) 생각을 하나하게 되었습니다. (이 당시에 제 네이버 개인 블로그에 엑셀 강의를 포스팅하고 있었습니다.) "MySQL, Oracle 등은 어차피 배운다고 했는데, 그럼 다른거는 데이터 베이스로 못쓸까? 엑셀(Excel)에는 분명 '저장' 및 CRUD가 가..

Side-Project 2019.12.08

[Python] 인스타그램 크롤링

개요 파이썬으로 만든 두번째 웹어플리케이션 입니다. 이 프로젝트 또한 네이버 크롤링에 이어, AMD로 일할때 Ctrl+c+v에 회의감을 느끼고 만든 프로그램입니다.사용자는 콘솔창에 원하는 해쉬태그만 입력하면 자동으로 인스타그램에 올라와 있는 게시물 정보를 모두 수집해 줍니다. 그리고 그 데이터를 .CSV 파일로 출력해 줍니다. 수집되는 정보 수집되는 정보로는 “본문, 글쓴이(ID), 좋아요, 글쓴날, 해쉬태그, URL” 입니다. 이 웹어플리케이션의 단점은 크롬 웹 드라이버를 사용하기 때문에 속도가 느립니다. 또한 사용자의 행위와 동일한 것을 자동화 시켜주는 것이기 때문에, 사용자의 부주의로 어플리케이션을 종료하거나 크롬 브라우저를 종료하면, 크롤링은 실패하게 됩니다. 상세 로직 참고 링크 시연 영상: Y..

Side-Project 2019.12.08

[Python] 네이버쇼핑 크롤링(Crawling)

소개말 이 프로젝트는 이베이코리아에서 AMD로 근무할때, 혼자서 만들어본 "네이버쇼핑 크롤링"프로그램 입니다. 만든 이유는 반복되는 일에 지루함과 귀찮음을 느껴 python을 공부하게되었고, 그 결과물 중 한 가지로 만들게 되었습니다. 수집되는 정보 쇼핑몰명, 최저가 상품명, 가격, 배송비, 리뷰 수 기본 로직 사용자는 메모장에 상품명만 줄바꿈을 기준으로 입력하면 자동으로 네이버 쇼핑에 올라와 있는 최저가 정보를 모두 수집해 줍니다. 그리고 그 데이터를 .CSV 파일로 출력해 줍니다. 상품 수의 제한은 없지만(메모장에 담고 저장만 할 수 있으면 됩니다.), 속도 조절을 하지 않으면 네이버 사이트로 공격이 될 수 있기 때문에 한 상품당 1초의 제한을 둡니다. 상세 로직 참고 링크 시연 영상: YouTube

Side-Project 2019.12.08
반응형