
http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
유혜영 고려대학교 정책대학원 2011 국내석사
통계에 대한 관심이 높아지면서 보다 좁은 영역이나 세분화된 단위의 통계에 대한 통계이용자들의 요구가 많아져 통계의 정확도와 조사비용은 유지하면서 정도 높은 소지역 통계수치를 얻기 위한 노력으로 소지역 추정에 관한 많은 연구가 이어져오고 있다. 서비스업조사는 지역별·산업별 매출총액에 대한 통계를 매년 작성하고 있는데, 소지역 추정방법으로 추출가중치를 적용한 직접추정량을 이용하고 있다. 직접추정량은 표본크기가 작을수록 분산이 커져 신뢰도가 낮게 나타나는 추정법으로 서비스업조사의 산업분류별 표본이 크지 않은 것을 감안할 때 추정치의 정확도가 낮아지는 것이 우려되고 있다. 본 논문에서는 서비스업조사의 산업분류별 추정량의 정확도를 높일 수 있는 다른 소지역 추정모형을 적용해보았다. 자료기반추정법인 직접추정법 외에 모형기반추정법인 회귀추정법, 그리고 직접추정법과 회귀추정법을선형결합한 복합추정법을 적용하여 각 산업분류별 매출총액에 대한 추정량을 구하고 각 추정량을 MSE를 통해 비교하였다. 회귀추정량을 구하기 위한 모형의 설명변수는 서비스업조사항목 내에서 매출액에 대한 설명력이 가장 높을 것으로 기대되는 종사자수 변수를 이용하였다. 산업분류별 자료의 수가 1개 이상인 크기 1000개의 표본을 뽑는 과정을 10000번 반복하여 직접추정량, 설명변수를 종사자수로 하는 회귀추정량, 직접추정량과 회귀추정량을 선형결합한 복합추정량을 구하고, 각 추정량의 전체평균, 분산, 그리고 원자료를 모수로 가정하여 편향(bias)을 구한 후, 이들을 이용하여 비교통계량 MSE를 도출하였다. 그리고 분산, 편향(bias), MSE를 통해 이들 추정량을 비교하였다.
본 저자는 리서치회사의 사회조사 분야에 근무하며, 여러 패널조사에 대해서 접해보았다. 그중에서 기업에 대한 패널조사의 경우 아직 우리나라에서 활성화 되지 않았으며, 가구 및 개인 패널조사에 비해서 연구가 덜 활성화 되어 있는 것으로 느껴졌다. 이에 기업에 대한 패널조사를 수행하는 입장에서 대체패널의 효율성에 대해서 직접 연구하여 효율적인 패널 대체방법의 탐색을 본 논문을 통해서 분석해 보려 한다. 최근 정부 및 공공기관의 패널조사 연구는 과거에 비해서 큰 증가세를 보이고 있으며, 이를 통해서 좀 더 과학적이고 체계적으로 시간에 따른 정책 및 제도의 효과를 파악이 가능해졌다. 하지만 초기 설계가 중요한 패널조사에서 체계적으로 준비되지 않은 조사 및 상황에 맞지 않는 조사 등으로 인해서 패널조사 데이터의 신뢰성이 떨어지며, 패널의 유지 및 대체 패널에 대해서도 정확한 인식의 부족으로 인하여 시행착오가 큰 것이 사실이다. 본 논문에서는 기존에 시행중인 기업패널 데이터를 분석하여 기존의 대체패널 데이터 및 탈락패널의 추정데이터 간의 비교를 통해 패널의 대체가 타당성 있게 이루어졌는지를 비교하고, 새로운 대체방법의 제시 및 이를 이용한 기존 대체패널데이터의 절삭을 통해서 새로운 대체방법의 효율성을 확인해 보았다. 이를 위해서 탈락패널 데이터와 대체패널의 데이터간의 비교를 위해서 회귀분석 및 다항 로지스틱 회귀분석을 적용하여 추정데이터를 생성하였으며, 그룹간 비교를 위해서 분산분석 및 교차분석을 통해 그룹간 비교검정을 수행하였다. 또한 최종적으로 기존대체패널 데이터에 새로운 대체방법을 적용하여 해당되지 않는 데이터를 절삭 후 원패널 데이터 그룹 및 기존 대체패널 데이터가 포함된 그룹, 절삭된 데이터 그룹간의 비교를 통해서 새로운 대체방법이 효율성이 있는지를 확인하였다.
스마트폰중독 진단척도(S-척도)의 구성타당도 검증 및 스마트폰중독 결정 요인분석
이창수 고려대학교 정책대학원 2016 국내석사
스마트폰 사용이 점차 증가함에 따라 스마트폰중독에 대한 연구의 중요성이 높아지고 있다. 스마트폰 중독에 대한 높은 관심과 활발한 연구 경향을 반영하여, 본 연구에서는 스마트폰중독 진단 척도(S-척도) 모형에 대한 구성타당도 검사 및 중독 결정 요인 분석을 실시하고자 한다. 본 연구에 사용된 데이터는 한국정보화진흥원에서 제공한 2014년 인터넷중독 실태조사의 자료(14,422건)이다. 구성타당도 검사를 위해 S-척도 응답데이터의 신뢰도 분석, 상관분석, 확인적 요인분석 결과를 통해 확인하였다. 스마트폰중독 결정 요인 분석은 반응변수를 두 가지로 두고 회귀분석을 실시하였다. 첫 번째 반응변수로는 고위험, 잠재적위험, 일반사용자군으로 구분된 스마트폰중독 유형(Y1)이며, 두 번째 반응변수로는 스마트폰중독 진단척도(총 15문항)의 총점(Y2)을 이용하여 분석을 실시하였다. 스마트폰중독 유형(Y1)이 반응변수일 경우에는 다항 로지스틱 회귀를 사용하였고, 총점(Y2)이 반응변수일 경우에는 다중 선형 회귀분석을 실시하였다. 분석 결과, 청소년/성인 스마트폰중독 진단 척도의 문항 간 상관관계에서는 역채점으로 실시한 3개 문항(청소년 문8번, 문10번, 문13번 / 성인 문4번, 문10번, 문15번)에서 상관계수가 거의 없는 것으로 나타났다. 또한, 확인적 요인분석에서도 역채점으로 실시한 3개 문항에서 집중타당성이 없는 것으로 나타났다. 한편 설명변수와 반응변수 Y1 간 카이제곱 통계량에서 청소년의 경우 11개 변수 중 3개만이 유의한 영향을 주는 것으로 나타났으며 설명변수와 반응변수 Y2 간 분산분석에서도 비슷한 결과가 나타나 청소년의 S-척도의 개선 및 보완이 필요하다고 판단되었다. 또한 다항 로지스틱 회귀모형의 오즈비와 다중 선형 회귀모형의 베타계수를 통해서 독립변수의 영향력을 비교해본 결과, 두 회귀모형의 영향력 있는 독립변수는 크게 다르게 나타났으며, 일부 범주에서는 결과 방향도 반대로 나타나는 경향을 보였다. 주요용어: 스마트폰중독 진단척도, 확인적 요인분석, 로지스틱 회귀모형 등
본연구는 확률 추정량의 안정성을 측정하는 목적으로 사용되는 Probability Coefficient of Variation(CV) 통계량의 특징을 살펴봄으로써 극단값에서 발생하는 p-CV의 특징을 살펴보았다. 표본설계 과정에 의해 계산되는 CV가 극단값에서 어떠한 현상을 나타내는지 살펴볼 필요 있는 미국건강영양조사 NHANES의 사례 중심의 연구를 진행하였다. 또한, 서베이 통계학에서 극단값 이슈 개선 사례들을 살펴보고 모의실험을 진행하였다. 제2장에서는 조사방법론 측면에서 snowballl sampling을 이용하여 극단값에서 발생할 수 있는 데이터 수집과정의 문제 해결 방안을 제시하였다. 제3장에서는 이항 값의 신뢰구간 추정 시 대표적으로 사용되는 wald 신뢰구간이 극단값에서 포함확률이 작아지는 단점을 해결하는 Agresti 신뢰구간 방안을 제시하였다. 그리고 본 연구의 취지인 CV 기준으로 안정적 설계 및 추정을 위해 근거를 제시할 모의실험을 진행하였다. 제4장의 모의실험을 통해 sample size를 키워가면서 구현되는 Coefficient of Variation sampling distribution의 특징을 살펴보았다. 특히 CV’s Coefficient of Variation을 통해 추정량의 안정성을 살펴봄으로써 이를 이용하여 안정적인 Data size 구축에 대한 가이드라인을 제시하였다. p-CV의 CV가 15%보다 작아야 한다는 기준을 이용하여 확률별로 안정적인 값을 도출할 수 있는 sample size를 제시하였다. 이는 데이터 분석 과정에서 이슈화 될 수 있는 imbalance data에 대하여 사용 가능하다. 신용사기 적발, 제품 불량률과 같이 추정 확률이 낮은 모수에 대하여 CV 관점으로 안정성을 확인하고 적절한 sample size를 제시함으로써 활용 할 수 있을 것이다.
전수층을 포함한 표본설계에서의 층화 방안 연구 : 사업체 조사의 경우
왜도가 큰 모집단을 대상으로 하는 사업체조사에서는 모집단에 대한 추정의 효율을 높이기 위해 일정 규모 이상의 사업체는 전수층으로, 일정 규모 미만의 사업체는 표본층으로 설정하는 층화추출법(Stratified Sampling)이 사용된다. 이에 따라 전수층과 표본층의 경계점을 결정하는 문제는 모집단의 추정의 정도(precision)에 직접적 영향을 미치는 중요한 논의점이 될 것이다. 본 논문은 전수층과 표본층의 최적 경계점을 결정하기 위한 새로운 방법을 제안한다. 기존 연구에 따라 이론적인 경계점을 검토하고 현재 사업체 조사의 기준과 제시한 Scree Plot 방안에 대한 추정의 효율을 비교하였다. 이를 통해 비교적 편리 하고 직관적인 방법으로 전수∙표본층의 층화 경계점을 결정하는 방안을 제시하고자 한다.
온라인 포털 댓글 감성분석을 통한 선거결과 예측 : 제 7회 서울시장선거를 중심으로
김기현 고려대학교 정책대학원 2020 국내석사
지난 제 7회 서울시장 선거에서 안철수 후보는 구글 트렌드 검색량은 1위였으나, 실제 투표결과는 3위였다. 본 연구는 그럼에도 불구하고 온라인 데이터를 취합하고 분석하는 방법에 의해 선거결과를 예측할 수 있음을 확인하고자 하였다. 이를 위해 제7회 서울시장 후보 관련하여 Naver와 Daum 정치뉴스에 작성된 댓글들을 웹크롤러로 수집하였다. 형태소분석을 통해 도출된 단어들을 대상으로 word2vec을 적용하여 후보자 관련 주제어 및 감성어휘를 추출하여 감성어 사전을 보완하였다. 또한 극성(polarity) 기반 감성분석을 실시한 결과를 후보자들의 총 버즈량내에서 점유율로 정규화하였다. 이를 여론조사 결과에 적합(fitting)하여 투표율 예측 모델링을 실시했다. 연구 결과 Daum 댓글에서의 긍정언급량, 부정 대비 긍정 비율이 높을수록 후보자의 득표율이 높아지고, 단순히 언급량이 많을 경우 오히려 득표율이 낮아지는 것으로 나타났다. 그리고 모델링을 통해 선거결과를 예측한 결과, 6%p 오차내에서 후보자들의 득표율을 예측하였으며, 후보자간 순위를 정확하게 맞추었다. 따라서 본 연구를 통해 포털 댓글로 대표되는 온라인데이터를 여론조사와 결합할 경우 선거결과를 예측할 수 있음을 발견했다. 향후 감성분석기법의 고도화 및 분석사례를 확대하여 온라인 데이터 분석결과의 일반화 검토를 후속연구로 제언한다. In the 7th Seoul mayoral election, candidate Ahn was ranked first in Google Trends, but actually voted third. Nevertheless, this study tried to confirm that the election results can be predicted by collecting and analyzing the online portal comments. To this end, using web crawlers to collect the comments made on Naver and Daum political news regarding the 7th mayor of Seoul. By applying word2vec to the words derived of morphological analysis, I extracted words regarding the candidates and emotional vocabulary to complement the emotional dictionary. In addition, the results of polarity-based emotional analysis were normalized to the ratio within the total buzz of the candidates. Fitting this to the poll results, the model predicted the percentage of votes. As a result, the higher the number of positive comments and the positive ratio against the negative in Daum comments, the higher the percentage of vote of the candidate. And predicting the election by the model, the candidates' percentage of vote was predicted within 6% p error, and the ranking among candidates was accurately matched. Therefore, this study found that the election results can be predicted by combining online data represented by portal comments with polls. In the future, I will try the generalization of the method of online data analysis for predicting election by increasing the cases.
정기 여론조사시 핵심항목 추정치 변동 보조정보를 활용한 층간 표본수 조정의 효용성 검토
안재호 고려대학교 정책대학원 2014 국내석사
정례적으로 실시되는 여론조사에서 매번 설문에 포함되는 핵심 조사항목의 추정치 변화 편차를 층별 표본수를 조정하는 기준으로 활용, 추정의 정확도를 높여보고자 하는 아이디어의 실효성을 시뮬레이션을 통해 검토하였다. 조사가 일정 횟수 이상 반복될 경우 핵심항목의 각층 추정치 변화폭은 정규분포로 수렴할 것이라는 전제가 성립한다면, 바로 직전 조사의 추정치와 변화폭의 표준편차를 이용해 표준화된 변수를 만들어 이를 바탕으로 표본을 할당하는 방안이 효율적일 수 있다는 가설을 검증하였다. 시뮬레이션을 위해 한국갤럽이 매주 공표하는 정례 여론조사 국정 지지도 추이를 사례로 활용하였고, 특히 전체 추정치의 표준오차 최소화에 주목하는 통상적 접근 방식과 달리 새로운 표본할당이 비례할당에 비해 각층 점 추정값의 오차를 평균적으로 얼마나 감소시킬 수 있을 지와 그 구체적 특성은 어떠한 지에 초점을 맞춰 분석을 진행하였다. 주제어 : 층별 표본할당, 비례할당, 동적 표본할당, 보조정보, 정례 여론조사, 소항목 여론조사
연동표본조사를 위한 추정량들의 비교 연구 : 경제활동 인구조사를 중심으로
본 논문의 목적은 연동표본조사를 시행하는 경제활동인구조사를 위한 새로운 실업률 추정방법을 제안하는 데 있다. 현행 경제활동인구조사는 표본개편에 의해서 연동표본조사를 도입하였으나 추정방안은 고정표본제와 동일한 사후층화추정방안이다. 기존의 추정방법은 연동편향을 보정할 수 없고, 1개월 자료만 이용하기 때문에 누적된 자료들을 효율적으로 이용할 수 없다는 단점을 가진다. 기존 방법과 달리 연동표본조사에 적용 가능한 추정량을 제시하기 위해서 누적된 과거자료들을 사용하여 연동그룹별 추정량 탐색하여 연동편향을 알아보았다. 또한 동일한 응답자가 반복적으로 조사를 받는 연동표본조사의 특성을 이용하여 각 연동그룹 추정량들을 시계열 모형에 적합한 뒤 타당한 모형을 정의했다. 정의된 모형을 이용하여 연동그룹내의 상관구조를 찾고 서로 다른 연동그룹 추정량들이 서로 독립적으로 추출된 점을 이용하여 전체 추정량들의 상관구조 및 분산-공분산행렬을 찾을 수 있고, 이를 통해 최량선형불편추정방안을 제시하였다. 더불어 일반적으로 사용하는 평균추정량과 연동그룹 추정량의 모형을 고려한 최량선형불편추정량을 비교한다. 또한 2008년~2010년 경제활동 자료에 적용하여 상대효율을 통해서 그 효율성을 평가한다. 이와 같은 방법은 과거자료 탐색을 통해 연동그룹 추정량들의 모형을 탐색한 뒤 모형을 기반으로한 최량선형불편추정량이므로 보다 안정적인 추정량을 산출할 수 있는 장점을 가진다. 또한 연동그룹간의 상관관계를 독립이라고 가정하였기 때문에 추정해야 할 모수가 적고, 쉽게 적용 가능하다는 장점이 있다. 하지만 3개년의 자료, 1회 차 연동표본 조사로는 1/36 연동표본조사의 추정량들이 모형을 확정하기에는 어렵다는 한계를 가지고 있다.