데이터 분석가의 KPI 그리고 소프트웨어 개발자의 KPI

약 9년의 소프트웨어 엔지니어 생활에서 데이터 분석분야로 업무 분야를 바꾼 뒤 약 3년 정도의 시행착오 끝에 현재 데이터 분석가로 탈바꿈을 했고, 어느정도 안정궤도에 올랐다는 생각이 들어 관련 내용을 정리하고자 이렇게 글을 써본다. “데이터를 분석한다” 많은 사람들이 위 문장을 사용하고 인식하는데 매우 큰 차이를 보이고 있다. 단순히 데이터 전처리 및 단어 카운팅을 하는것을 분석행위라 하는 것 […]

계속 읽기

어제의 엄청난 방문자수는 블랙스완? – 블로그 방문자수 예측 모형 –

이 블로그는 호스팅을 받기 때문에 트래픽에 대한 어느정도의 예상치는 알고 있어야 나중에 곤욕을 당하지 않는다. 바로 어제(2014.12.12) 이문열 삼국지 텍스트 분석 포스팅의 엄청난 인기 때문에 약 세번의 트래픽 리셋이 있었고, 거기다 추가적으로 매일 4G의 웹 트래픽을 더 구입해서 임시적으로나마 내년 2월 중순까지 버텨 보기로 했다(트래픽 최소 구입 단위가 4G였으며, 기간은 무조건 호스팅 계약 종료시까지였다). 아래와 […]

계속 읽기

카카오톡 보이스톡 데이터 시각화

R에는 다양한 웹의 데이터를 끌어와 분석을 할 수 있는 장점이 있다. 흥미롭게도 카카오톡의 홈페이지는 군더더기 없이 깔끔하게 웹 테이블을 구성해 놓고 있어 생각보다 빨리 시각화를 할 수 있었다. 군산에서 서울로 가는 무궁화호 기차 안에서 카카오톡 보이스톡 품질 관련 글을 읽고 생각이 나서 시각화 및 관련 글을 써봤다(애들이 좀 크니 예전처럼 기차에서 글을 보거나 블로깅을 하는것도 […]

계속 읽기

Google Analytics 데이터로 블로그 방문자 분석하기

블로그 방문자 추이데이터를 2011년 가량부터 수집해오고 있어 이를 rga패키지를 이용해서 분석해 보았다. 자세한 사용법은 R에서 Google Analytics 데이터 사용하기와 Analysing your e-commerce funnel with R을 참고하길 바란다. suppressPackageStartupMessages({ library(rga) library(lubridate) library(xts) library(magrittr) library(dplyr) library(ggplot2) library(forecast) }) rga.open(instance="ga", where="ga.rga") daily_visits_src <- ga$getData( key, start.date = "2011-01-01", end.date = "2014-08-27", metrics = "ga:users", dimensions = "ga:date", sort […]

계속 읽기

R에서 Pipe 연산으로 분석하기

magrittr 패키지가 최근에 많은 화제를 불러 일으키고 있다. 사실 이 패키지는 패키지 자체로 유명세를 탔다고 하기 보다는 다른 유명 패키지가 이 패키지를 사용하게 됨으로써 유명세를 탓고 필자도 현재 이 패키지 때문에 dplyr과 같은 패키지를 자연스럽게 사용하게 되었다. 이 패키지는 유닉스에 있는 파이프(|, >) 연산자와 같은 기능을 아래와 같이 R에서 쓸 수 있게 해주는 연산자이다. library(magrittr) […]

계속 읽기

내가 쓰는 맥용 .Rprofile

금일 서울대학교 강좌를 진행하면서 필자 맥북의 .Rprofile공유를 요청하셔서 이렇게 올려본다. 아래 스크립트의 앞부분은 링크에서 설명을 하지만 맥에서 기본 그래픽 디바이스인 quartz디바이스의 한글 설정을 해주는 스크립트 이다. 그리고 마지막 라인은 자바 설정으로 KoNLP를 맥에서 사용할때 권장하는 설정 내용이다. 물론 다른 OS에서도 설정해주면 좋다. -Xmx8g부분은 본인의 시스템 메모리를 고려해서 적당하게 설정하면 된다. stringsAsFactors 부분은 데이터를 읽어들일때 R이 […]

계속 읽기

Resampling으로 회귀계수 검정

re-sampling 방법으로 회귀모형 파라메터를 검정해보기로 한다. 개인적으로는 리샘플링 방법이 직관적이고 설명이 편한 장점이 있어서 자주 쓰고자 하는 소망을 가지고 있고 금번 포스팅도 그 일환이다. 무엇보다 우리 주변의 컴퓨팅 파워는 놀고 있으니 요즘들어 안쓸 이유가 없는 방법이라 생각한다. … suppressPackageStartupMessages(library(UsingR)) suppressPackageStartupMessages(library(data.table)) suppressPackageStartupMessages(library(extrafont)) data(father.son) coeffs <- data.table() #2만번 re-sampling for(i in 1:20000){ rfheigh <- sample(father.son$fheight) rsheigh <- […]

계속 읽기

베이지언 책에 대한 이야기

뭔가 새로운걸 배울땐 여러 책을 구입해 겹쳐읽기를 하는 패턴으로 학습을 하곤한다. 이 방법의 장점은 같은 주제의 설명을 다른 저자로부터 들을 수 있다는 것이고 이 덕분에 빨리 제대로된 이해를 할 수 있게 된다.  이번 전반기에 구입한 베이지언 책들은 크게 국내서와 해외서로 나눌 수 있는데 개인적으로 가장 만족감을 느꼈던 국내서 한권과 해외서 한권을 소개한다. 물론 개인의 여건에 […]

계속 읽기

몇가지 베이지언 계산 방법 정리

지금까지 알고 있는 몇가지 방식의 베이지언 계산법 정리를 해볼 필요가 있어서 같은 문제를 여러 방법으로 살펴봤다. 상세한 모델 설계를 할 수 있는 jags 또는 좀더 빠르다고 하는 stan을 좀더 익숙하게 쓸 수 있도록 좀 살펴볼 필요가 있을거 같다. 그리고 여러 실 활용 예들을 찾아서 책을 좀 뒤적이도록 하자! Grid Approximation library(rjags) library(MCMCpack) library(extrafont) library(ggthemes) library(ggmcmc) […]

계속 읽기