분류
2021년 8월
작성일
2021.04.08
수정일
2021.07.12
작성자
이정훈
조회수
158

비감독 학습 뉴럴 언어모형 기반의 문맥의존 철자오류 교정

 

  본 논문은 영어 문서를 대상으로 문맥의존 철자오류 문제를 해결하고자 한다. 철자오류 종류는 두 가지로 단순 철자오류와 문맥의존 철자오류로 나뉜다. 단순 철자오류는 사전의 단어와 매칭만으로 오류를 찾을 수 있기 때문에 교정하기가 쉽지만 문맥의존 철자오류는 교정 대상 단어와 주변 문맥의 관계를 파악해야 오류 유무를 알 수 있기 때문에 교정의 난이도가 높아진다. 문맥오류의 세부 종류로 동음이의어 오류(homophone error), 문자 배열의 오류(typographical error), 문법 오류(grammatical error), 띄어쓰기 오류(cross word boundary error)로 나뉘며, 논문에서는 띄어쓰기 오류를 제외한 문맥의존 철자오류에 해당하는 나머지 오류에 대해서 다룬다. 그리고 문맥의존 철자오류의 검색은 통계적 방식을 사용하며, 최종 교정어 선택은 딥러닝(deep learning) 방식을 사용하여 문맥의존 철자오류 문제를 해결한다. 논문에서는 기존 문맥의존 철자오류 교정에 다뤄지지 않은 여러 뉴럴 언어모형을 교정에 적용 한다. 논문에서 제안하는 뉴럴 언어모형을 이용한 교정 기법은 크게 5가지로 Word embedding 정보 기반의 교정, Contextual embedding 정보 기반의 교정, Auto-regressive(AR) 계열 언어모형 기반의 교정, Auto-encoding(AE) 계열 언어모형 기반의 교정, Encoder- Decoder 계열 언어모형 기반의 교정으로 나뉜다. 본 논문에서는 최근까지 발표된 15가지 뉴럴 언어모형을 이용해서 문맥의존 철자오류 교정 실험을 진행한다. 논문에서는 교정 대상 단어를 기준으로 양방향의 문맥 정보를 참조하여 교정을 실험하며, 단방향으로 들어오는 입력이나 파라미터 조절을 이용한 성능 실험도 진행하였다. 성능의 측정은 오류어 검색(detection), 오류어 교정(correction)을 각각 정확도(precistion), 재현율(recall), F1으로 표현한다. 논문에서는 문맥의존 철자오류 교정 테스트 말뭉치 구축에 관한 내용도 다루며, 웹에서 얻어진 1조 어절로 구성된 말뭉치를 이용해 실제 사용자들의 오류를 추출하여 성능 테스트에서 제시한다.


* e-mail : it_leejh@pusan.ac.kr

학위연월
2021년 8월
지도교수
권혁철
키워드
Context-sensitive spelling error correction, natural language processing, word embedding, contextual embedding, auto-regressive, auto-encoding, permutation language model
소개 웹페이지
http://corpus.pusan.ac.kr/graduate/2021_lee/index.html
첨부파일
첨부파일이(가) 없습니다.
다음글
Automatic Assessment and Collaborative Mentoring System for Programming Education
류샤오 2021-10-13 10:12:29.87
이전글
A New Framework for Handling and Generating Indoor Semantic Information by Massive Raw Points Toward the Digital Twin
김태훈 2021-04-08 14:49:14.147
RSS 2.0 135
게시물 검색
박사학위논문
번호 제목 작성자 작성일 첨부파일 조회수
135 Differentially Private Data-Centric Mechanism for 새글 우타리예바 아쎔 2025.10.10 0 27
134 Adaptive Penalty Optimization and Scalable Quantum 정선근 2025.10.02 0 42
133 Comparative Complexity of Neuropeptide and Recepto 류승희 2025.10.01 0 46
132 확산 모델 기반 필기 이미지 생성에 관한 연구 홍동진 2025.04.10 0 140
131 연합학습 기반 그래프 신경망을 활용한 전기차 충전소 최적 선택 기법 류준우 2025.04.09 0 122
130 Exploring Quantum Approach Applied to Cryptanalysi 와다니 리니 위스누 2025.04.08 0 140
129 Towards computation - communication efficient and 응우옌 민 두옹 2025.04.08 0 108
128 Hybrid Quantum Residual Neural Networks for Classi 노대일 2025.04.08 0 133
127 Distributed Resource Management for Massive IoT Ne 응우옌 쑤언 둥 2025.04.08 0 97
126 A Framework for Leveraging Large Language Models i 데리 프라타마 2025.04.07 0 140
125 Discovery and Authentication of Marker Genes Using 프라타마 리안 다니스 아디 2025.04.07 0 152
124 산업 환경의 IEEE 802.15.4 TSCH 기반 네트워크에서 트래픽 처리량 향상을 위한 이희준 2025.04.07 0 130
123 Uncertainty-Based Hybrid Deep Learning Approach fo 멘가라 악셀 기드온 2024.12.10 0 163
122 Effective Deep Learning Primitives Design for Bina 황선진 2024.10.14 0 162
121 Toward Immersive Multiview Video Streaming through 탄중 디온 2024.10.14 0 127
120 A Low-cost Deep Learning Model for Real-time Low L 등 제강 2024.10.10 0 184
119 Enhancing Nested Entity Recognition Using Nested R 양홍진 2024.10.09 0 146
118 다양한 도메인과 데이터 형식에 강건한 사전학습 언어모델 기반의 표 질의응답 방법 조상현 2024.10.09 0 160
117 Trust Guard Extension for Enhanced Security Featur 김해용 2024.05.04 0 217
116 Task-Specific Differential Private Data Publish Me 신진명 2024.04.09 0 189