CWN(CHANGE WITH NEWS) - 말뭉치(corpus) 연구의 활용

  • 구름조금속초6.5℃
  • 맑음김해시-1.6℃
  • 맑음정읍-4.6℃
  • 맑음영주-7.7℃
  • 맑음경주시-2.7℃
  • 맑음부안-2.1℃
  • 맑음함양군-9.0℃
  • 맑음영월-7.6℃
  • 맑음울릉도4.1℃
  • 맑음완도-1.4℃
  • 구름조금대관령-2.0℃
  • 흐림원주-4.2℃
  • 맑음고창-5.8℃
  • 맑음강진군-5.3℃
  • 맑음의성-9.3℃
  • 맑음남원-7.3℃
  • 맑음동해3.0℃
  • 맑음산청-8.1℃
  • 맑음서귀포4.9℃
  • 맑음춘천-5.6℃
  • 맑음울진1.6℃
  • 맑음금산-7.6℃
  • 맑음울산-0.2℃
  • 맑음북강릉2.8℃
  • 맑음대구-3.8℃
  • 맑음순천-7.6℃
  • 맑음고창군-4.5℃
  • 구름조금서산2.9℃
  • 흐림철원-6.6℃
  • 맑음영덕0.6℃
  • 맑음장수-9.2℃
  • 맑음양산시-1.5℃
  • 맑음상주-5.3℃
  • 구름많음수원-2.5℃
  • 구름조금제주5.3℃
  • 맑음전주-3.6℃
  • 맑음강릉5.1℃
  • 맑음북부산-5.6℃
  • 흐림백령도9.0℃
  • 맑음천안-4.9℃
  • 맑음포항0.7℃
  • 맑음진도군-3.2℃
  • 맑음북춘천-5.9℃
  • 흐림부여-4.3℃
  • 맑음의령군-9.0℃
  • 맑음봉화-10.6℃
  • 맑음합천-7.3℃
  • 맑음영광군-5.0℃
  • 맑음홍천-4.4℃
  • 맑음해남-5.7℃
  • 흐림양평-3.5℃
  • 맑음북창원-2.1℃
  • 흐림인제-4.8℃
  • 맑음밀양-5.9℃
  • 맑음진주-6.7℃
  • 맑음고흥-7.6℃
  • 맑음거창-8.6℃
  • 맑음광주-3.0℃
  • 흐림동두천-2.1℃
  • 맑음거제-1.9℃
  • 맑음구미-6.1℃
  • 맑음군산-2.6℃
  • 흐림강화1.1℃
  • 맑음문경-6.0℃
  • 구름조금흑산도5.6℃
  • 맑음보은-8.1℃
  • 맑음장흥-6.7℃
  • 구름조금서울-0.9℃
  • 맑음임실-7.7℃
  • 흐림이천-5.9℃
  • 맑음보성군-4.8℃
  • 맑음충주-7.2℃
  • 맑음여수-0.9℃
  • 맑음대전-4.8℃
  • 맑음부산1.2℃
  • 구름많음청주-2.8℃
  • 맑음성산4.2℃
  • 흐림태백-2.9℃
  • 맑음순창군-7.2℃
  • 맑음추풍령-8.1℃
  • 구름많음보령2.7℃
  • 맑음영천-6.6℃
  • 맑음창원0.0℃
  • 흐림정선군-9.2℃
  • 맑음남해-1.1℃
  • 맑음안동-7.3℃
  • 맑음청송군-10.1℃
  • 맑음고산7.0℃
  • 맑음제천-7.7℃
  • 구름많음홍성1.0℃
  • 맑음세종-5.1℃
  • 맑음서청주-5.0℃
  • 흐림파주-4.5℃
  • 맑음통영-0.3℃
  • 흐림인천1.6℃
  • 구름조금목포-1.1℃
  • 맑음광양시-2.7℃
  • 2025.12.06 (토)

말뭉치(corpus) 연구의 활용

이수린 / 기사승인 : 2021-03-20 20:32:34
  • -
  • +
  • 인쇄

인공지능 변호사 로스(Ross), 챗봇 엘리자(ELIZA), 구글 번역기. 모두 우리가 모두 한 번 쯤 들어보거나 사용해본 인공지능(AI)이다. 모두 ‘말뭉치 언어학’을 활용한다는 공통점이 있다.

말뭉치란 사람들이 실제로 사용하는 언어 사례를 모아 놓은 자료를 말한다. 말뭉치를 분석하여 언어가 실제로 어떤 양상으로 사용되는지, 사람들의 인식 속에 언어가 어떻게 저장되어 있는지 탐구할 수 있다. 말뭉치 언어학이 AI 개발에도 활용되면서 말뭉치 언어학에 대한 관심이 높아지고 있다.

대표적으로 말뭉치 언어학을 활용하여 만드는 AI 챗봇은 사람들과 대화를 하면 할수록 그 대화 속의 패턴을 찾아내어 해당 패턴에는 어떤 대답을 내놓을지 결정한다. 대화를 많이 하면 할수록 대화 패턴에 대한 정보가 많아지고, 챗봇은 더 다양한 대답을 내놓을 수 있게 된다.

[ELIZA가 패턴을 찾아내는 코드의 예시]

말뭉치 언어학은 일반 언어 데이터와는 달리 사람이 실제로 사용하는 언어를 분석한다는 점에서 일상에서 사람들과 대화하는 AI 연구에 적합하다.

예를 들어, ‘몇 시?’라는 한국어 문장은 주어와 목적어 등 문장을 이루는 구조가 다 생략되어 있고 대화 상황에 따라 단순 물음/불쾌감 표시 등 의미가 달라질 수 있다. 단순히 문법적인 언어만 모아둔 데이터에는 없지만, 말뭉치 데이터는 문법적 언어와 상황 분석 데이터를 지니고 있다. 따라서 AI는 말이 사용되는 상황도 함께 학습할 수 있게 도와준다.

특히, 말뭉치 언어학은 사투리가 심하거나 어순이 자유로운 언어일수록 빛을 발한다. 이렇듯 앞으로 말뭉치 언어학이 AI 개발 분야에서 얼마나 큰 역할을 하게 될지 관심이 쏠리고 있다.

[저작권자ⓒ CWN(CHANGE WITH NEWS). 무단전재-재배포 금지]

최신기사

뉴스댓글 >

- 띄어 쓰기를 포함하여 250자 이내로 써주세요.
- 건전한 토론문화를 위해, 타인에게 불쾌감을 주는 욕설/비방/허위/명예훼손/도배 등의 댓글은 표시가 제한됩니다.

댓글 0

Today

Hot Issue