분류
2021년 8월
작성일
2021.04.08
수정일
2021.07.12
작성자
이정훈
조회수
149

비감독 학습 뉴럴 언어모형 기반의 문맥의존 철자오류 교정

 

  본 논문은 영어 문서를 대상으로 문맥의존 철자오류 문제를 해결하고자 한다. 철자오류 종류는 두 가지로 단순 철자오류와 문맥의존 철자오류로 나뉜다. 단순 철자오류는 사전의 단어와 매칭만으로 오류를 찾을 수 있기 때문에 교정하기가 쉽지만 문맥의존 철자오류는 교정 대상 단어와 주변 문맥의 관계를 파악해야 오류 유무를 알 수 있기 때문에 교정의 난이도가 높아진다. 문맥오류의 세부 종류로 동음이의어 오류(homophone error), 문자 배열의 오류(typographical error), 문법 오류(grammatical error), 띄어쓰기 오류(cross word boundary error)로 나뉘며, 논문에서는 띄어쓰기 오류를 제외한 문맥의존 철자오류에 해당하는 나머지 오류에 대해서 다룬다. 그리고 문맥의존 철자오류의 검색은 통계적 방식을 사용하며, 최종 교정어 선택은 딥러닝(deep learning) 방식을 사용하여 문맥의존 철자오류 문제를 해결한다. 논문에서는 기존 문맥의존 철자오류 교정에 다뤄지지 않은 여러 뉴럴 언어모형을 교정에 적용 한다. 논문에서 제안하는 뉴럴 언어모형을 이용한 교정 기법은 크게 5가지로 Word embedding 정보 기반의 교정, Contextual embedding 정보 기반의 교정, Auto-regressive(AR) 계열 언어모형 기반의 교정, Auto-encoding(AE) 계열 언어모형 기반의 교정, Encoder- Decoder 계열 언어모형 기반의 교정으로 나뉜다. 본 논문에서는 최근까지 발표된 15가지 뉴럴 언어모형을 이용해서 문맥의존 철자오류 교정 실험을 진행한다. 논문에서는 교정 대상 단어를 기준으로 양방향의 문맥 정보를 참조하여 교정을 실험하며, 단방향으로 들어오는 입력이나 파라미터 조절을 이용한 성능 실험도 진행하였다. 성능의 측정은 오류어 검색(detection), 오류어 교정(correction)을 각각 정확도(precistion), 재현율(recall), F1으로 표현한다. 논문에서는 문맥의존 철자오류 교정 테스트 말뭉치 구축에 관한 내용도 다루며, 웹에서 얻어진 1조 어절로 구성된 말뭉치를 이용해 실제 사용자들의 오류를 추출하여 성능 테스트에서 제시한다.


* e-mail : it_leejh@pusan.ac.kr

학위연월
2021년 8월
지도교수
권혁철
키워드
Context-sensitive spelling error correction, natural language processing, word embedding, contextual embedding, auto-regressive, auto-encoding, permutation language model
소개 웹페이지
http://corpus.pusan.ac.kr/graduate/2021_lee/index.html
첨부파일
첨부파일이(가) 없습니다.
다음글
Automatic Assessment and Collaborative Mentoring System for Programming Education
류샤오 2021-10-13 10:12:29.87
이전글
A New Framework for Handling and Generating Indoor Semantic Information by Massive Raw Points Toward the Digital Twin
김태훈 2021-04-08 14:49:14.147
RSS 2.0 132
게시물 검색
박사학위논문
번호 제목 작성자 작성일 첨부파일 조회수
132 확산 모델 기반 필기 이미지 생성에 관한 연구 홍동진 2025.04.10 0 116
131 연합학습 기반 그래프 신경망을 활용한 전기차 충전소 최적 선택 기법 류준우 2025.04.09 0 101
130 Exploring Quantum Approach Applied to Cryptanalysi 와다니 리니 위스누 2025.04.08 0 102
129 Towards computation - communication efficient and 응우옌 민 두옹 2025.04.08 0 94
128 Hybrid Quantum Residual Neural Networks for Classi 노대일 2025.04.08 0 114
127 Distributed Resource Management for Massive IoT Ne 응우옌 쑤언 둥 2025.04.08 0 83
126 A Framework for Leveraging Large Language Models i 데리 프라타마 2025.04.07 0 129
125 Discovery and Authentication of Marker Genes Using 프라타마 리안 다니스 아디 2025.04.07 0 139
124 산업 환경의 IEEE 802.15.4 TSCH 기반 네트워크에서 트래픽 처리량 향상을 위한 이희준 2025.04.07 0 116
123 Uncertainty-Based Hybrid Deep Learning Approach fo 멘가라 악셀 기드온 2024.12.10 0 143
122 Effective Deep Learning Primitives Design for Bina 황선진 2024.10.14 0 149
121 Toward Immersive Multiview Video Streaming through 탄중 디온 2024.10.14 0 113
120 A Low-cost Deep Learning Model for Real-time Low L 등 제강 2024.10.10 0 173
119 Enhancing Nested Entity Recognition Using Nested R 양홍진 2024.10.09 0 133
118 다양한 도메인과 데이터 형식에 강건한 사전학습 언어모델 기반의 표 질의응답 방법 조상현 2024.10.09 0 144
117 Trust Guard Extension for Enhanced Security Featur 김해용 2024.05.04 0 188
116 Task-Specific Differential Private Data Publish Me 신진명 2024.04.09 0 178
115 Advanced Defense Framework against Physical Advers 김용수 2024.04.08 0 205
114 한글 메신저 채팅의 크로스 텍스팅 탐지를 위한 저자 검증 모형 이다영 2024.04.05 0 184
113 상태 기반 테스트 시나리오 보강 방법 이선열 2023.10.17 0 260