권호기사보기
| 기사명 | 저자명 | 페이지 | 원문 | 기사목차 |
|---|
결과 내 검색
동의어 포함
[목적] 본 연구는 토픽 모델링의 성능을 향상시키기 위해 불용어 제거 방법을 최적화하는 데 초점을 맞추었다. 이를 위해 정규화된 점별상호정보량(NPMI)과 TF-IDF 기준 중위수를 결합하여 불용어를 자동으로 생성하고 그 효과를 분석하는데 목적이 있다.
[방법] 연구 대상은 ‘태권도 겨루기’를 키워드로 포함하는 443개의 논문에서 추출한 텍스트 데이터이며 NPMI를 활용하여불용어 후보를 선정한 후 TF-IDF 값이 낮은 순서대로 30개의 불용어를 추출하였다. 이후 불용어 개수를 1개에서 30개까지 순차적으로 증가시키면서 u_mass score 변화를 측정하였다.
[결과] NPMI와 TF-IDF를 활용한 불용어 자동 생성 방법이 의미론적 일관성 지표(u_mass score)를 향상시키는 데 긍정적인 영향을 미치는 것으로 나타났다(R2 =.456, p<.001). 또한, 불용어 개수가 증가할수록 의미론적 일관성이 향상되는 경향을 보였으나 일정 개수를 초과하면 오히려 성능이 저하되는 수확체감의 법칙(diminishing returns)이 확인되었다. 불용어200개를 제거했을 때 u_mass score가 가장 높은 값(-11.442)을 기록하였으며 이는 불용어 개수 최적화의 중요성을 시사한다. 반면, 연구자가 주관적으로 선정한 불용어를 적용한 경우 최적 토픽 수는 5개, u_mass score는 -16.001로 상대적으로 낮은 의미론적 일관성을 보였다. 이러한 결과는 NPMI 기반 불용어 제거의 한계를 보완하기 위해 TF-IDF를 함께 고려해야 함을 시사하며 기존 PMI2 , PMI2 기반 접근법보다 정보량이 높은 단어를 효과적으로 보존할 수 있음을 시사한다.
[결론] 연구자에 의한 주관적 불용어 제거는 연구결과의 재생가능성을 저해하므로 특정 도메인과 데이터 규모에 따라 최적화되어야 할 필요성이 있으며 향후 연구에서는 다양한 도메인에서 본 연구의 방법론을 검증하고 일반화할 필요가 있다.*표시는 필수 입력사항입니다.
| 전화번호 |
|---|
| 기사명 | 저자명 | 페이지 | 원문 | 기사목차 |
|---|
| 번호 | 발행일자 | 권호명 | 제본정보 | 자료실 | 원문 | 신청 페이지 |
|---|
도서위치안내: / 서가번호:
우편복사 목록담기를 완료하였습니다.
*표시는 필수 입력사항입니다.
저장 되었습니다.