Crawler에 대한 추가 생각들

주말에 blog comment를 구하기 위해 오랫동안 썩혀 두었던 웹 크롤러를 꺼내들고 오랜만에 돌려 봤다. 테크노라티 분야별  top 블로거의 양질의 comment 1만건을 뽑아 왔다.  데이터를 뽑아서 좀 보니 색다른 아이디어도 생각나더라. 내 크롤러는 대용량이나 웹검색을 위해서 만든건 아니고, 100만건 이하의 웹을 크롤링 하는데 적합한 크롤러다. 노트북에 크롤러를 돌려보면서 크롤러를 대용량 검색을 위해서 바꾼다면 어떻게 해볼까 생각을 […]

계속 읽기

Dsitributed Index

예전에 Distribute Indexing에 대해서 글을 써본적이 있는데, 아주 아이디얼하게 시작 문자로 분산을 시켰었다. 오늘은 어떤것을 기준으로 대용량 분산을 하면 될지 한번 생각해 보려고 한다. 아마도 이것은 Query Processing에 대한 글과도 관련이 있을거 같다는 생각이 든다. (top k개의 결과만 가져오면 된다는 가정을 하고 기술하기 때문이다.) hadoop과 같은 mapreduce기반의 시스템은 분산시 쓰이는 function을 제공한다. 그리고 또한 이것들을 […]

계속 읽기

Yahoo!에서 Hadoop이 어떻게 쓰일까?

야후에서 직접 Hadoop이 내부적으로 어떻게 쓰이는지 공개 했다. 뭐 쓰임새야 야후직원이고 평소 관심이 많아 알고 있었던 사실이고 직접 써보기 까지 했으니… 내부 자료인데, 적당한 레벨에서 공개를 한거 같다. 실제 Hadoop에 대한 소개글 수준인 Doug Cutting의 ppt 보다 Eric의 ppt가 볼만하다.왜냐면 실무에서 어떻게 사용이 되는지 간단하게 나마 소개되어 있기 때문이다. Hadoop at OSCON Yahoo!의 Hadoop cluster […]

계속 읽기

전화영어

요즘 아침마다 전화영어 하느라 바쁘다. (방금 전화영어 끝났다. ) 한달 전만해도 압박에 잠을 잘 못잘지경이였는데, 이제는 익숙해져서 그정도 까지는 아니다. 처음에 YBMSISA에서 하는 전화영어를 한달동안 했었는데, 뭔가 체계도 없고 수강료가 상당히 비싸고, 가장 중요한것은 내가 원하는 가격 내에서 격일밖에 이용을 못한다는 것이였다. (그러나 강사의 발음은 최고.) 그래서 바꾼 전화영어는 engbell이라는 전화영어 전문사이트였는데, 그 수많은 전화영어 […]

계속 읽기

Machine Learning과 MapReduce는 천생연분

일반적으로 많은 데이터를 학습 시킬때 메모리나 프로세서의 부족으로 학습에 많은 시간이 걸리는 고질적인 문제가 있다. 학습 데이터의 차원이 늘어날 때마다 필요한 메모리는 기하급수적으로 늘어나기 때문인데,  코드 레벨에서나 알고리즘 레벨에서 복잡도를 줄이는건 새로운 알고리즘을 창안하지 않는이상 거의 불가능 하다.(뭔 약간의 코드 핫스팟을 찾아서 최적화를 시켜주는건 가능하겠지만.) 그래서 분산처리를 사용해 시간(전체) 복잡도를 줄이고자 하는 논문이 스텐포드에서 나왔다. […]

계속 읽기

블로그에서 수집한 spam comment 및 spam trackback의 ip 통계

약 2주동안 이곳 블로그에서 수집한 2만8천여건의 spam comment 와 trackback의 ip통계를 종합해 봤다. 약 97%의 spam들이 5%의 스팸IP에 집중되어 있었다. 국적은 유럽쪽이 가장 많았고, 그 다음이 북미, 그 다음이 동아시아쪽(대만) 인걸로 나왔다. 한국에서 돌린 스팸도 있었는데, ip정보가 파워콤이라고 나오는군. 이 결과가 전체 블로그 스피어의 결과를 대변하지는 않겠지만, 몇몇 블로거들이 함께 sampling 해본다면 한국 전체 블로그 […]

계속 읽기

금일 모 언론사 컨설팅(?) 내용

어제 교수님과 식사겸 논문 세미나를 했는데, 국내 모 언론사에 다니시는 대학원 원우님께서 나의 논문주제에 이번에도 상당한 관심을 보이셨다.그런데 아니다 다를까 오늘 전화를 하셔서 많은 내용을 물어보셨다. 문제는 덧글 스팸에 대한건데, 요즘 이놈이 글을 읽는데 상당한 재미를 제공해 주기도 하지만 그와 반면에 엄청난 스팸이 달려서 이것때문에 골치가 아프다는 말씀을 하셨다. (요즘 악플도 문제다. 그 종교문제로 인한….) […]

계속 읽기

영어 Blog comment 구합니다.(2)

블로그 comment 및 tracback 스팸 2만여건을 구했다. 왜 진작에 이런 생각을 못했는지.. ㅜㅜ 바로 EAS(Eolin Anti SpamServer)라는 플러그인을 살짝 바꿔서 스팸인 comment들을 파일로 저장하게끔 만들었고, 또한 코드를 확인해서 DB 쓰레기통에 있던 spam 처리된 comment 와 trackback을 찾아내서 백업했다. EAS 내부적으로 잠깐 소스를 보자면 1. 10개정도의 중복 comment가 달릴경우 blocking한다. (이것은 내부 DB를 이용한다.)2. 1번에서 필터링 […]

계속 읽기

영어 Blog comment 구합니다.

논문을 쓴는데 trining set을 구하는게 제일 힘든 문제인거 같다. 심지어 이런 문제가 주제를 판가름 하는 factor로 작용할 수도 있다니.. 쩝. 안타까운 현실이군. 1. 일단 구하지 못한다면, crawler를 써서 크롤링 하는 방법을 생각할 수 있겠다.2. spam 판정을 하기위해 알바라도 써야될거 같다. 그리고 blog comment를 살 수 있는 사이트도 있는거 같은데, 돈 조금 주고 사버릴까도 하네. 근데 […]

계속 읽기