본문 바로가기 주메뉴 바로가기
국회도서관 홈으로 정보검색 소장정보 검색

결과 내 검색

동의어 포함

목차보기

표제지 1

목차 5

요약문 3

SUMMARY 4

제1장 서론 11

1.1. 연구배경 12

1.1.1. 지식베이스 필요성 12

1.1.2. 비정형 텍스트 데이터 분류 및 정보 추출 기술의 발전 15

1.2. 연구범위 및 목적 17

제2장 자료 및 분석방법 19

2.1. 국내 뉴스 데이터 20

2.2. 해외 뉴스 데이터 21

2.3. 국내논문 데이터 22

제3장 데이터 분류 기술 정확도 향상 23

3.1. 국내뉴스 재난유형별 분류 24

3.1.1. 분석방법 24

3.1.2/3.1.1. Commercial API-served Large language model(C-LLMs)을 활용한 데이터 라벨링 28

3.1.3/3.1.2. Open-source Fine-tunable Pre-trained Language Models(F-PLMs)의 파인 튜닝 29

3.1.4/3.1.2. C-LLM 모델들과 F-PLM의 모델들의 정확도 비교 30

3.2. 국내뉴스 재난관리 문제점 33

3.2.1. 분석방법 33

3.2.2. 키워드 기반 재난 관련 뉴스 분류 34

3.2.3. BERT 기반 부정뉴스 분류 35

3.2.4. LLM 활용 재난관리 단계 분류 37

3.2.5. 재난관리 단계별 재난안전예산과 부정뉴스 보도 비교 41

3.3. 해외뉴스 재난유형별 분류 42

3.3.1. 분석방법 43

3.3.2. 제목 기반 모델링 45

3.3.3. 제목과 본문을 모두 고려한 모델링 48

3.4. 국내논문 재난안전 문제점 및 개선방안 분류 52

3.4.1. 분석방법 53

3.4.2. 단일모델(Single Model) 성능 비교ㆍ평가 54

3.4.3. 앙상블 모델(Ensemble Model) 성능 비교ㆍ평가 55

3.4.4. 최적의 LLM 앙상블 모델 활용 분류 58

3.4.5. BERT를 활용한 재난안전 문제점 및 개선방안 분류 모델링 63

3.5. 데이터 색인 체계 마련 64

제4장 데이터 분류기술 및 지식베이스 활용 업무매뉴얼 개발 71

4.1. 지식베이스 활용 내역 72

4.2. 국내뉴스(재난유형, 부정뉴스, 정책뉴스) 분류 프로그램 실행 절차 75

4.3. 국내뉴스 문장단위(지적사항, 개선대책) 추출 프로그램 실행 절차 83

4.4. 실시간 재난안전 언론 현황 서비스 운영 프로그램 실행 절차 88

4.4.1. 실제 활용 절차 91

4.5. 재난안전제도 관련 뉴스 모니터링 운영 프로그램 실행 절차 93

4.6. 국내논문 지적사항 분류 프로그램 실행 절차 97

4.7. 해외뉴스 지적사항 분류 프로그램 실행 절차 102

4.8. 재난안전 위험정보 탐색 시스템 사용자 매뉴얼 106

제5장 요약 및 결론 107

참고문헌 112

[부록 1] 앙상블 모델별 성능 비교 114

판권기 120

표목차 9

표 1.1. 주요 분야별 지식베이스 구축 및 활용 사례 13

표 2.1. 연구에서 활용된 언론진흥재단 30개 언론사 종류 21

표 3.1. 언론사별 수집된 총뉴스 건수와 재난뉴스의 비율 26

표 3.2. 재난 유형에 대한 Gemini-2.0과 GPT-3.5의 응답 일치율 28

표 3.3. Learning Rate 변화에 따른 BERT와 KoELECTRA 모델의 (F1-Score) 변화 30

표 3.4. 반복횟수(Epoch) 변화에 따른 BERT와 KoELECTRA 모델의 정확도(F1-Score) 변화 30

표 3.5. 모델별 정확도(F1-Score) 비교 31

표 3.6. BERT_KoELECTRA Soft-Vote과 사람이 직접 분류한 결과의 정확도 비교 32

표 3.7. 국내뉴스 지적사항 분석에 활용된 자연재난ㆍ사회재난 유형 목록 34

표 3.8. 부정뉴스 분류 모델의 하이퍼파라미터 탐색 결과 36

표 3.9. LLM 모델별 재난관리단계 분류 성능 및 특성 38

표 3.10. 재난안전 유형별(레이블) 학습 및 검증 데이터 건수 44

표 3.11. 학습데이터별 모델 성능 비교 50

표 3.12. 12개 업무유형과 관련된 주요 키워드 65

표 3.13. 시설유형과 관련된 주요 키워드 68

표 3.14. 데이터 종류 별 DB 구축 내역 70

표 4.1. 기술개발 주요성과(정책ㆍ업무 수행 및 지원 실적) 74

표 4.2. BERT 결과를 우선 적용하는 경우 79

표 4.3. 사전 기반은 "none", BERT는 특정 재난으로 판단한 경우 80

표 4.4. BERT는 "none", 사전 기반은 특정 재난으로 판단한 경우 80

표 4.5. 단계별 요약 표 81

표 4.6. 재난뉴스 자동 분석 시스템 결과 예시 82

표 4.7. 단계별 요약 표 87

표 4.8. 주요 이슈 변경 방법 92

표 4.9. 국내논문 재난안전 문제점 및 개선방안 판별 단계 97

표 4.10. 작업 순서 및 수정사항 요약 101

표 4.11. 해외뉴스 지적사항 추출 프로세스 단계별 역할 및 관련 파일 103

표 4.12. 작업 순서 및 수정사항 요약 105

표 5.1. BERT 기반 분류모델 목표치 및 실제 정확도(F1-Score) 109

표 5.2. 데이터 유형별 구축된 기간 110

그림목차 7

그림 1.1. 연구배경 및 목적 17

그림 2.1. 한국언론진흥재단 뉴스기사 DB제공 누리집(http://newstore.or.kr) 20

그림 3.1. 재난유형별 뉴스 건수 27

그림 3.2. 재난뉴스 연도별 추세 35

그림 3.3. 부정뉴스 연도별 추세 37

그림 3.4. 부정뉴스 재난관리 4단계 분류 결과 38

그림 3.5. 재난관리 4단계별 주요 키워드 39

그림 3.6. 시기별 재난관리 4단계 부정뉴스 비율 변화 40

그림 3.7. 재난관리 단계별 정부 예산 배분(왼)과 언론 부정뉴스 보도(오)의 비교 41

그림 3.8. 해외뉴스 모델링 성능(제목 기반) 45

그림 3.9. 재난안전 유형별 precision, recall, f1-Score(제목 기반) 46

그림 3.10. 재난안전 유형별 f1-score 분포(제목 기반) 47

그림 3.11. 해외뉴스 모델링 성능(제목+본문 기반) 48

그림 3.12. 재난안전 유형별 precision, recall, f1-Score(제목+본문 기반) 49

그림 3.13. 재난안전 유형별 f1-score 분포(제목+본문 기반) 50

그림 3.14. 단일모델별 분류 성능 비교 55

그림 3.15. LLM 앙상블 모델별 성능 비교(상위 10개) 57

그림 3.16. 공통 분류 워드클라우드 59

그림 3.17. 공통 분류 공출현 네트워크 59

그림 3.18. 자연재난 논문 제목 워드 클라우드 상위 3개 60

그림 3.19. 자연재난 공출현 네트워크 상위 3개 61

그림 3.20. 사회재난 논문 제목 워드 클라우드 상위 3개 62

그림 3.21. 사회재난 공출현 네트워크 상위 3개 62

그림 3.22. 재난안전 지식베이스 색인 체계 70

그림 4.1. 실시간 재난안전 언론 현황 서비스 메인 화면 91

그림 4.2. 주요 이슈 등 4개 탭 뉴스 표출 화면 92

그림 4.3. 최근 재난 뉴스 표출, 속보 등 표출 화면 92

그림 4.4. 재난안전 위험정보 탐색 시스템(R-Scanner) 화면 106

부록표목차 10

부록 표 1.1. 앙상블 모델별 성능 비교(전체) 115