분류
2021년 8월
작성일
2021.04.08
수정일
2021.07.12
작성자
이정훈
조회수
134

비감독 학습 뉴럴 언어모형 기반의 문맥의존 철자오류 교정

 

  본 논문은 영어 문서를 대상으로 문맥의존 철자오류 문제를 해결하고자 한다. 철자오류 종류는 두 가지로 단순 철자오류와 문맥의존 철자오류로 나뉜다. 단순 철자오류는 사전의 단어와 매칭만으로 오류를 찾을 수 있기 때문에 교정하기가 쉽지만 문맥의존 철자오류는 교정 대상 단어와 주변 문맥의 관계를 파악해야 오류 유무를 알 수 있기 때문에 교정의 난이도가 높아진다. 문맥오류의 세부 종류로 동음이의어 오류(homophone error), 문자 배열의 오류(typographical error), 문법 오류(grammatical error), 띄어쓰기 오류(cross word boundary error)로 나뉘며, 논문에서는 띄어쓰기 오류를 제외한 문맥의존 철자오류에 해당하는 나머지 오류에 대해서 다룬다. 그리고 문맥의존 철자오류의 검색은 통계적 방식을 사용하며, 최종 교정어 선택은 딥러닝(deep learning) 방식을 사용하여 문맥의존 철자오류 문제를 해결한다. 논문에서는 기존 문맥의존 철자오류 교정에 다뤄지지 않은 여러 뉴럴 언어모형을 교정에 적용 한다. 논문에서 제안하는 뉴럴 언어모형을 이용한 교정 기법은 크게 5가지로 Word embedding 정보 기반의 교정, Contextual embedding 정보 기반의 교정, Auto-regressive(AR) 계열 언어모형 기반의 교정, Auto-encoding(AE) 계열 언어모형 기반의 교정, Encoder- Decoder 계열 언어모형 기반의 교정으로 나뉜다. 본 논문에서는 최근까지 발표된 15가지 뉴럴 언어모형을 이용해서 문맥의존 철자오류 교정 실험을 진행한다. 논문에서는 교정 대상 단어를 기준으로 양방향의 문맥 정보를 참조하여 교정을 실험하며, 단방향으로 들어오는 입력이나 파라미터 조절을 이용한 성능 실험도 진행하였다. 성능의 측정은 오류어 검색(detection), 오류어 교정(correction)을 각각 정확도(precistion), 재현율(recall), F1으로 표현한다. 논문에서는 문맥의존 철자오류 교정 테스트 말뭉치 구축에 관한 내용도 다루며, 웹에서 얻어진 1조 어절로 구성된 말뭉치를 이용해 실제 사용자들의 오류를 추출하여 성능 테스트에서 제시한다.


* e-mail : it_leejh@pusan.ac.kr

학위연월
2021년 8월
지도교수
권혁철
키워드
Context-sensitive spelling error correction, natural language processing, word embedding, contextual embedding, auto-regressive, auto-encoding, permutation language model
소개 웹페이지
http://corpus.pusan.ac.kr/graduate/2021_lee/index.html
첨부파일
첨부파일이(가) 없습니다.
다음글
Automatic Assessment and Collaborative Mentoring System for Programming Education
류샤오 2021-10-13 10:12:29.87
이전글
A New Framework for Handling and Generating Indoor Semantic Information by Massive Raw Points Toward the Digital Twin
김태훈 2021-04-08 14:49:14.147
RSS 2.0 132
게시물 검색
박사학위논문
번호 제목 작성자 작성일 첨부파일 조회수
132 확산 모델 기반 필기 이미지 생성에 관한 연구 홍동진 2025.04.10 0 69
131 연합 학습 기반 전기차 충전 인프라 최적 운영 및 전력망 안정을 위한 유연성 자원 활용 연 류준우 2025.04.09 0 66
130 Design and Analysis of Quantum Circuits for Inform 와다니 리니 위스누 2025.04.08 0 67
129 Towards computation - communication efficient and 응우옌 민 두옹 2025.04.08 0 70
128 Quantum Convolutional Neural Networks for Classifi 노대일 2025.04.08 0 69
127 Service Management for Reliable Distributed 6G IoT 응우옌 쑤언 둥 2025.04.08 0 59
126 Large Language Model for Penetration Testing Domai 데리 프라타마 2025.04.07 0 97
125 Discovery and Authentication of Marker Genes Using 프라타마 리안 다니스 아디 2025.04.07 0 86
124 산업 환경의 IEEE 802.15.4 TSCH 기반 네트워크에서 트래픽 처리량 향상을 위한 이희준 2025.04.07 0 95
123 Uncertainty-Based Hybrid Deep Learning Approach fo 멘가라 악셀 기드온 2024.12.10 0 120
122 Effective Deep Learning Primitives Design for Bina 황선진 2024.10.14 0 129
121 Toward Immersive Multiview Video Streaming through 탄중 디온 2024.10.14 0 89
120 A Low-cost Deep Learning Model for Real-time Low L 등 제강 2024.10.10 0 143
119 Enhancing Nested Entity Recognition Using Nested R 양홍진 2024.10.09 0 111
118 다양한 도메인과 데이터 형식에 강건한 사전학습 언어모델 기반의 표 질의응답 방법 조상현 2024.10.09 0 126
117 Trust Guard Extension for Enhanced Security Featur 김해용 2024.05.04 0 150
116 Task-Specific Differential Private Data Publish Me 신진명 2024.04.09 0 165
115 Advanced Defense Framework against Physical Advers 김용수 2024.04.08 0 189
114 한글 메신저 채팅의 크로스 텍스팅 탐지를 위한 저자 검증 모형 이다영 2024.04.05 0 164
113 상태 기반 테스트 시나리오 보강 방법 이선열 2023.10.17 0 242