KR101851790B1 - 질문 데이터 세트 확장 장치 및 방법 - Google Patents
질문 데이터 세트 확장 장치 및 방법 Download PDFInfo
- Publication number
- KR101851790B1 KR101851790B1 KR1020170178791A KR20170178791A KR101851790B1 KR 101851790 B1 KR101851790 B1 KR 101851790B1 KR 1020170178791 A KR1020170178791 A KR 1020170178791A KR 20170178791 A KR20170178791 A KR 20170178791A KR 101851790 B1 KR101851790 B1 KR 101851790B1
- Authority
- KR
- South Korea
- Prior art keywords
- similar
- similarity
- domain
- phrase
- generation module
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Expired - Fee Related
Links
Images
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/004—Artificial life, i.e. computing arrangements simulating life
-
- G06N99/005—
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Health & Medical Sciences (AREA)
- Computing Systems (AREA)
- Biomedical Technology (AREA)
- Biophysics (AREA)
- Computational Linguistics (AREA)
- Data Mining & Analysis (AREA)
- Evolutionary Computation (AREA)
- Life Sciences & Earth Sciences (AREA)
- Molecular Biology (AREA)
- Artificial Intelligence (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Health & Medical Sciences (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
- Machine Translation (AREA)
Abstract
Description
도 1은 챗봇의 기본적인 모듈 구성을 도시한 모식도,
도 2는 일반적인 챗봇 모듈 구성을 구체적으로 도시한 모식도,
도 3은 머신러닝을 이용한 챗봇 모듈 구성을 구체적으로 도시한 모식도,
도 4는 본 발명의 일실시예에 따른 트레이닝 세트 생성 장치와 챗봇 인공지능 모듈과의 관계를 나타낸 모식도,
도 5는 본 발명의 일실시예에 따른 트레이닝 세트 생성 장치를 도시한 모식도,
도 6은 본 발명의 다른 실시예에 따른 트레이닝 세트 생성 장치를 도시한 모식도,
도 7은 본 발명의 일실시예에 따른 트레이닝 세트 생성 방법을 도시한 흐름도,
도 8은 본 발명의 일실시예에 따른 트레이닝 세트 생성 방법의 각 단계별 결과 예시를 도시한 것,
도 9는 본 발명의 제2실시예에 따른 트레이닝 세트 생성 방법을 도시한 흐름도,
도 10은 본 발명의 제2실시예에 따른 트레이닝 세트 생성 방법의 각 단계별 결과 예시를 도시한 것이다.
2: 구분 모듈
3: 유사어구 생성 모듈
4: 유사문장 생성 모듈
4': 도메인 유사문장 생성 모듈
21: NLP 모듈
22: 벡터화 모듈
31: 도메인 스코어 판정 모듈
32: 도메인 유사어구 생성 모듈
41: 문법 생성 모듈
42: 톤 생성 모듈
100: 챗봇 인공지능 모듈
200: 기본 질문데이터
201: 실제 질문데이터
Claims (3)
- 수신된 질문 데이터에서 적어도 하나의 개체, 의미구 또는 개체와 의미구의 조합으로 구성된 어구 정보를 생성하며, 상기 어구 정보를 치환할 수 있도록 유사도가 높은 적어도 하나의 유사어구 정보를 생성하는 유사어구 생성 모듈;
상기 유사어구 생성 모듈에서 생성된 상기 유사어구 정보의 General corpus에서의 어구 출현 빈도를 의미하는 일반 출현 정보와 상기 질문 데이터에서의 어구 출현 빈도를 의미하는 도메인 출현 정보를 비교하여, 상기 유사어구 정보의 도메인 특징 정도를 의미하는 도메인 스코어 정보를 생성하는 도메인 스코어 생성 모듈;
상기 도메인 스코어 생성 모듈에서 생성된 상기 유사어구 정보의 도메인 스코어 정보를 가중치로 하여 상기 유사어구 정보의 상기 유사도를 스케일링하고, 스케일링된 상기 유사도에 특정 cutoff-value를 적용하여 도메인 유사어구를 한정적으로 선정하는 도메인 유사어구 생성 모듈;
상기 도메인 유사어구 정보를 이용하여 상기 질문 데이터의 문장과 유사한 적어도 하나 이상의 제1유사문장을 생성하는 유사문장 생성 모듈;
상기 유사문장 생성 모듈에서 수신된 상기 제1유사문장에 복수개의 문법 규칙을 적용하여 복수개의 제2유사문장을 생성하는 문법 생성 모듈; 및
상기 문법 생성 모듈에서 생성된 복수개의 상기 제2유사문장에 복수개의 발화 톤을 적용하여 복수개의 제3유사문장을 생성하는 톤 생성 모듈;
을 포함하고,
상기 유사어구 생성 모듈에서의 상기 유사도는 General corpus에서의 유사도 또는 의미 네트워크(Semantic Network)에서의 유사도를 이용하며,
기존의 질문 데이터 세트에서 상기 질문 데이터가 분류된 레이블에 생성된 상기 제3유사문장을 통합하여 질문 데이터 세트를 확장시키는,
질문 데이터 세트 확장 장치.
- 유사어구 생성 모듈이, 질문 데이터에서 적어도 하나의 개체, 의미구 또는 개체와 의미구의 조합으로 구성된 어구 정보를 생성하며, 상기 어구 정보를 치환할 수 있도록 유사도가 높은 적어도 하나의 유사어구 정보를 생성하는 유사어구 생성 단계;
도메인 스코어 생성 모듈이, 상기 유사어구 생성 모듈에서 생성된 상기 유사어구 정보의 General corpus에서의 어구 출현 빈도를 의미하는 일반 출현 정보와 상기 질문 데이터에서의 어구 출현 빈도를 의미하는 도메인 출현 정보를 비교하여, 상기 유사어구 정보의 도메인 특징 정도를 의미하는 도메인 스코어 정보를 생성하는 도메인 스코어 생성 단계;
도메인 유사어구 생성 모듈이, 상기 도메인 스코어 생성 모듈에서 생성된 상기 유사어구 정보의 도메인 스코어 정보를 가중치로 하여 상기 유사어구 정보의 상기 유사도를 스케일링하고, 스케일링된 상기 유사도에 특정 cutoff-value를 적용하여 도메인 유사어구를 한정적으로 선정하는 도메인 유사어구 생성 단계;
유사문장 생성 모듈이, 상기 도메인 유사어구 정보를 이용하여 상기 질문 데이터의 문장과 유사한 적어도 하나 이상의 제1유사문장을 생성하는 유사문장 생성 단계;
문법 생성 모듈이, 상기 유사문장 생성 모듈에서 수신된 상기 제1유사문장에 복수개의 문법 규칙을 적용하여 복수개의 제2유사문장을 생성하는 문법 생성 단계; 및
톤 생성 모듈이, 상기 문법 생성 모듈에서 생성된 복수개의 상기 제2유사문장에 복수개의 발화 톤을 적용하여 복수개의 제3유사문장을 생성하는 톤 생성 단계;
를 포함하고,
상기 유사어구 생성 모듈에서의 상기 유사도는 General corpus에서의 유사도 또는 의미 네트워크(Semantic Network)에서의 유사도를 이용하며,
기존의 질문 데이터 세트에서 상기 질문 데이터가 분류된 레이블에 생성된 상기 제3유사문장을 통합하여 질문 데이터 세트를 확장시키는,
질문 데이터 세트 확장 방법.
- 유사어구 생성 모듈이, 질문 데이터에서 적어도 하나의 개체, 의미구 또는 개체와 의미구의 조합으로 구성된 어구 정보를 생성하며, 상기 어구 정보를 치환할 수 있도록 유사도가 높은 적어도 하나의 유사어구 정보를 생성하는 유사어구 생성 단계;
도메인 스코어 생성 모듈이, 상기 유사어구 생성 모듈에서 생성된 상기 유사어구 정보의 General corpus에서의 어구 출현 빈도를 의미하는 일반 출현 정보와 상기 질문 데이터에서의 어구 출현 빈도를 의미하는 도메인 출현 정보를 비교하여, 상기 유사어구 정보의 도메인 특징 정도를 의미하는 도메인 스코어 정보를 생성하는 도메인 스코어 생성 단계;
도메인 유사어구 생성 모듈이, 상기 도메인 스코어 생성 모듈에서 생성된 상기 유사어구 정보의 도메인 스코어 정보를 가중치로 하여 상기 유사어구 정보의 상기 유사도를 스케일링하고, 스케일링된 상기 유사도에 특정 cutoff-value를 적용하여 도메인 유사어구를 한정적으로 선정하는 도메인 유사어구 생성 단계;
유사문장 생성 모듈이, 상기 도메인 유사어구 정보를 이용하여 상기 질문 데이터의 문장과 유사한 적어도 하나 이상의 제1유사문장을 생성하는 유사문장 생성 단계;
문법 생성 모듈이, 상기 유사문장 생성 모듈에서 수신된 상기 제1유사문장에 복수개의 문법 규칙을 적용하여 복수개의 제2유사문장을 생성하는 문법 생성 단계; 및
톤 생성 모듈이, 상기 문법 생성 모듈에서 생성된 복수개의 상기 제2유사문장에 복수개의 발화 톤을 적용하여 복수개의 제3유사문장을 생성하는 톤 생성 단계;
를 포함하고,
상기 유사어구 생성 모듈에서의 상기 유사도는 General corpus에서의 유사도 또는 의미 네트워크(Semantic Network)에서의 유사도를 이용하며,
기존의 질문 데이터 세트에서 상기 질문 데이터가 분류된 레이블에 생성된 상기 제3유사문장을 통합하여 질문 데이터 세트를 확장시키는,
질문 데이터 세트 확장 방법을 컴퓨터 상에서 수행하는 기록매체에 저장된 프로그램.
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020170178791A KR101851790B1 (ko) | 2017-12-22 | 2017-12-22 | 질문 데이터 세트 확장 장치 및 방법 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| KR1020170178791A KR101851790B1 (ko) | 2017-12-22 | 2017-12-22 | 질문 데이터 세트 확장 장치 및 방법 |
Related Parent Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| KR1020170034887A Division KR101851785B1 (ko) | 2017-03-20 | 2017-03-20 | 챗봇의 트레이닝 세트 생성 장치 및 방법 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| KR101851790B1 true KR101851790B1 (ko) | 2018-04-24 |
Family
ID=62087473
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| KR1020170178791A Expired - Fee Related KR101851790B1 (ko) | 2017-12-22 | 2017-12-22 | 질문 데이터 세트 확장 장치 및 방법 |
Country Status (1)
| Country | Link |
|---|---|
| KR (1) | KR101851790B1 (ko) |
Cited By (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR102103563B1 (ko) | 2018-12-31 | 2020-04-22 | 충남대학교산학협력단 | 챗봇을 이용한 사용자 명령어의 태깅처리 시스템 |
| CN111708873A (zh) * | 2020-06-15 | 2020-09-25 | 腾讯科技(深圳)有限公司 | 智能问答方法、装置、计算机设备和存储介质 |
| US10841251B1 (en) * | 2020-02-11 | 2020-11-17 | Moveworks, Inc. | Multi-domain chatbot |
| KR20220087183A (ko) * | 2020-12-17 | 2022-06-24 | 삼성생명보험주식회사 | 챗봇 시스템의 문장 생성 및 검증 방법 |
| KR20220129713A (ko) * | 2021-03-16 | 2022-09-26 | 주식회사 웨이센 | 복수 의미 유형 단어의 단일 의미 유형 단어로의 라벨링 방법 |
| KR20230050673A (ko) * | 2021-10-08 | 2023-04-17 | 주식회사 리니토 | 자연어이해 학습 모델을 위한 학습데이터의 이중 증강 방법 및 장치 |
| KR20230099828A (ko) | 2021-12-28 | 2023-07-05 | 주식회사 케이티 | 문장을 분류하는 장치, 방법 및 컴퓨터 프로그램 |
Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR101309042B1 (ko) | 2012-09-17 | 2013-09-16 | 포항공과대학교 산학협력단 | 다중 도메인 음성 대화 장치 및 이를 이용한 다중 도메인 음성 대화 방법 |
-
2017
- 2017-12-22 KR KR1020170178791A patent/KR101851790B1/ko not_active Expired - Fee Related
Patent Citations (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR101309042B1 (ko) | 2012-09-17 | 2013-09-16 | 포항공과대학교 산학협력단 | 다중 도메인 음성 대화 장치 및 이를 이용한 다중 도메인 음성 대화 방법 |
Non-Patent Citations (2)
| Title |
|---|
| Zhang, Wei-Nan, et al. "A topic clustering approach to finding similar questions from large question and answer archives." PloS one 9.3, 2014.3.4. |
| Zhang, Yu, et al. "Phrasal paraphrase based question reformulation for archived question retrieval." PloS one 8.6, 2013.6.21. |
Cited By (11)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR102103563B1 (ko) | 2018-12-31 | 2020-04-22 | 충남대학교산학협력단 | 챗봇을 이용한 사용자 명령어의 태깅처리 시스템 |
| US10841251B1 (en) * | 2020-02-11 | 2020-11-17 | Moveworks, Inc. | Multi-domain chatbot |
| CN111708873A (zh) * | 2020-06-15 | 2020-09-25 | 腾讯科技(深圳)有限公司 | 智能问答方法、装置、计算机设备和存储介质 |
| CN111708873B (zh) * | 2020-06-15 | 2023-11-24 | 腾讯科技(深圳)有限公司 | 智能问答方法、装置、计算机设备和存储介质 |
| KR20220087183A (ko) * | 2020-12-17 | 2022-06-24 | 삼성생명보험주식회사 | 챗봇 시스템의 문장 생성 및 검증 방법 |
| KR102540563B1 (ko) | 2020-12-17 | 2023-06-05 | 삼성생명보험주식회사 | 챗봇 시스템의 문장 생성 및 검증 방법 |
| KR20220129713A (ko) * | 2021-03-16 | 2022-09-26 | 주식회사 웨이센 | 복수 의미 유형 단어의 단일 의미 유형 단어로의 라벨링 방법 |
| KR102579293B1 (ko) | 2021-03-16 | 2023-09-18 | 주식회사 웨이센 | 복수 의미 유형 단어의 단일 의미 유형 단어로의 라벨링 방법 |
| KR20230050673A (ko) * | 2021-10-08 | 2023-04-17 | 주식회사 리니토 | 자연어이해 학습 모델을 위한 학습데이터의 이중 증강 방법 및 장치 |
| KR102626714B1 (ko) * | 2021-10-08 | 2024-01-23 | 주식회사 리니토 | 자연어이해 학습 모델을 위한 학습데이터의 이중 증강 방법 및 장치 |
| KR20230099828A (ko) | 2021-12-28 | 2023-07-05 | 주식회사 케이티 | 문장을 분류하는 장치, 방법 및 컴퓨터 프로그램 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| KR101851785B1 (ko) | 챗봇의 트레이닝 세트 생성 장치 및 방법 | |
| KR101851790B1 (ko) | 질문 데이터 세트 확장 장치 및 방법 | |
| US12406138B2 (en) | System for providing intelligent part of speech processing of complex natural language | |
| KR101851789B1 (ko) | 도메인 유사어구 생성 장치 및 방법 | |
| Bonta et al. | A comprehensive study on lexicon based approaches for sentiment analysis | |
| US12130850B2 (en) | Model-based semantic text searching | |
| CN110337645B (zh) | 可适配的处理组件 | |
| US10262062B2 (en) | Natural language system question classifier, semantic representations, and logical form templates | |
| US11983501B2 (en) | Apparatus and method for automatic generation of machine reading comprehension training data | |
| US9740685B2 (en) | Generation of natural language processing model for an information domain | |
| US20220414463A1 (en) | Automated troubleshooter | |
| US8335683B2 (en) | System for using statistical classifiers for spoken language understanding | |
| JP6663826B2 (ja) | 計算機及び応答の生成方法 | |
| KR20190133931A (ko) | 문장 패러프레이즈 인식 기반 대화 시스템 답변 방법 | |
| US20130018824A1 (en) | Sentiment classifiers based on feature extraction | |
| US11151117B2 (en) | Increasing the accuracy of a statement by analyzing the relationships between entities in a knowledge graph | |
| CN110727796A (zh) | 面向分级读物的多尺度难度向量分类方法 | |
| US20240127026A1 (en) | Shallow-deep machine learning classifier and method | |
| KR101851786B1 (ko) | 챗봇의 트레이닝 세트 레이블링을 위한 가상 레이블 생성 장치 및 방법 | |
| CN107148624A (zh) | 预处理文本的方法以及用于执行该方法的预处理系统 | |
| JP2017091000A (ja) | 文書処理装置、方法、およびプログラム | |
| Mataoui et al. | A new syntax-based aspect detection approach for sentiment analysis in Arabic reviews | |
| KR101851791B1 (ko) | 도메인 특화 용어 및 고빈도 일반 용어를 이용한 도메인 다양성 계산 장치 및 방법 | |
| Sangeetha et al. | Exploration of sentiment analysis techniques on a multilingual dataset dealing with tamil-english reviews | |
| Sun et al. | Hierarchical verb clustering using graph factorization |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PA0107 | Divisional application |
St.27 status event code: A-0-1-A10-A16-div-PA0107 St.27 status event code: A-0-1-A10-A18-div-PA0107 |
|
| PA0201 | Request for examination |
St.27 status event code: A-1-2-D10-D11-exm-PA0201 |
|
| PA0302 | Request for accelerated examination |
St.27 status event code: A-1-2-D10-D16-exm-PA0302 St.27 status event code: A-1-2-D10-D17-exm-PA0302 |
|
| P11-X000 | Amendment of application requested |
St.27 status event code: A-2-2-P10-P11-nap-X000 |
|
| P13-X000 | Application amended |
St.27 status event code: A-2-2-P10-P13-nap-X000 |
|
| E701 | Decision to grant or registration of patent right | ||
| PE0701 | Decision of registration |
St.27 status event code: A-1-2-D10-D22-exm-PE0701 |
|
| GRNT | Written decision to grant | ||
| PR0701 | Registration of establishment |
St.27 status event code: A-2-4-F10-F11-exm-PR0701 |
|
| PR1002 | Payment of registration fee |
Fee payment year number: 1 St.27 status event code: A-2-2-U10-U11-oth-PR1002 |
|
| PG1601 | Publication of registration |
St.27 status event code: A-4-4-Q10-Q13-nap-PG1601 |
|
| P22-X000 | Classification modified |
St.27 status event code: A-4-4-P10-P22-nap-X000 |
|
| P22-X000 | Classification modified |
St.27 status event code: A-4-4-P10-P22-nap-X000 |
|
| P22-X000 | Classification modified |
St.27 status event code: A-4-4-P10-P22-nap-X000 |
|
| PN2301 | Change of applicant |
St.27 status event code: A-5-5-R10-R11-asn-PN2301 |
|
| PN2301 | Change of applicant |
St.27 status event code: A-5-5-R10-R14-asn-PN2301 |
|
| P14-X000 | Amendment of ip right document requested |
St.27 status event code: A-5-5-P10-P14-nap-X000 |
|
| P16-X000 | Ip right document amended |
St.27 status event code: A-5-5-P10-P16-nap-X000 |
|
| Q16-X000 | A copy of ip right certificate issued |
St.27 status event code: A-4-4-Q10-Q16-nap-X000 |
|
| PR1001 | Payment of annual fee |
Fee payment year number: 4 St.27 status event code: A-4-4-U10-U11-oth-PR1001 |
|
| PC1903 | Unpaid annual fee |
Not in force date: 20220419 Payment event data comment text: Termination Category : DEFAULT_OF_REGISTRATION_FEE St.27 status event code: A-4-4-U10-U13-oth-PC1903 |
|
| PC1903 | Unpaid annual fee |
Ip right cessation event data comment text: Termination Category : DEFAULT_OF_REGISTRATION_FEE Not in force date: 20220419 St.27 status event code: N-4-6-H10-H13-oth-PC1903 |