CWN(CHANGE WITH NEWS) - 미디어젠, 초거대 언어 모델 TTA 성능 검증 통과

  • 흐림청송군19.6℃
  • 구름많음의령군24.6℃
  • 구름많음남원22.8℃
  • 구름많음김해시23.7℃
  • 구름조금속초19.7℃
  • 구름많음통영24.9℃
  • 흐림전주22.6℃
  • 흐림임실21.1℃
  • 구름조금남해25.4℃
  • 구름많음북창원26.6℃
  • 흐림홍성23.2℃
  • 흐림대전23.3℃
  • 구름많음고창21.3℃
  • 구름많음순창군21.4℃
  • 맑음고흥24.0℃
  • 흐림장수22.0℃
  • 구름많음거창23.1℃
  • 흐림정선군19.0℃
  • 흐림태백16.5℃
  • 비대구22.0℃
  • 비안동20.7℃
  • 흐림수원21.9℃
  • 흐림천안22.4℃
  • 흐림동해19.4℃
  • 흐림영주20.7℃
  • 흐림보령22.6℃
  • 흐림광주22.7℃
  • 구름조금동두천18.5℃
  • 구름많음강릉19.8℃
  • 흐림상주21.8℃
  • 구름많음서산22.0℃
  • 흐림이천20.4℃
  • 흐림추풍령21.9℃
  • 구름조금철원17.7℃
  • 흐림울릉도21.0℃
  • 흐림보은23.0℃
  • 흐림영월20.0℃
  • 흐림부여22.6℃
  • 흐림경주시20.8℃
  • 구름조금강화18.8℃
  • 구름많음산청23.8℃
  • 구름많음함양군23.4℃
  • 구름조금서귀포26.7℃
  • 흐림대관령15.1℃
  • 구름많음북강릉18.8℃
  • 흐림양평21.0℃
  • 구름많음인천22.2℃
  • 구름조금고산26.3℃
  • 흐림봉화19.6℃
  • 구름많음진주24.6℃
  • 구름조금광양시24.4℃
  • 흐림정읍21.6℃
  • 흐림세종22.1℃
  • 구름조금보성군23.6℃
  • 맑음장흥22.4℃
  • 구름많음북부산23.1℃
  • 구름조금파주18.8℃
  • 흐림영천20.4℃
  • 흐림청주24.3℃
  • 흐림영덕19.6℃
  • 구름많음양산시23.3℃
  • 맑음해남22.4℃
  • 구름많음부산23.1℃
  • 구름많음원주21.6℃
  • 구름조금성산24.8℃
  • 맑음여수24.8℃
  • 맑음완도24.0℃
  • 구름많음순천21.9℃
  • 흐림흑산도23.6℃
  • 구름많음목포23.7℃
  • 구름많음합천24.7℃
  • 흐림홍천20.0℃
  • 구름조금백령도20.8℃
  • 흐림제천20.2℃
  • 흐림서청주23.0℃
  • 구름많음서울22.0℃
  • 흐림구미22.2℃
  • 구름조금인제17.4℃
  • 흐림금산23.4℃
  • 흐림고창군21.2℃
  • 흐림밀양23.6℃
  • 흐림울진20.7℃
  • 구름조금제주27.1℃
  • 구름많음울산20.6℃
  • 비포항21.6℃
  • 흐림문경21.1℃
  • 구름많음북춘천19.5℃
  • 맑음진도군21.7℃
  • 흐림의성20.8℃
  • 구름많음창원25.0℃
  • 구름많음거제24.2℃
  • 흐림군산22.4℃
  • 맑음강진군22.8℃
  • 흐림부안22.4℃
  • 흐림충주22.2℃
  • 구름많음춘천19.8℃
  • 구름많음영광군21.8℃
  • 2025.09.14 (일)

미디어젠, 초거대 언어 모델 TTA 성능 검증 통과

이성호 기자 / 기사승인 : 2024-01-17 15:50:53
  • -
  • +
  • 인쇄
한국지능정보사회진흥원(NIA) 초거대 AI 학습용 헬스케어 질의응답 데이터 구축 완료
미디어젠 마곡 R&D 센터 사옥 전경. 사진=미디어젠
미디어젠 마곡 R&D 센터 사옥 전경. 사진=미디어젠

[CWN 이성호 기자] 미디어젠 컨소시엄이 인공지능 데이터 활용해 제작한 초거대 언어 모델(LLM)이 TTA의 성능 검증을 통과했다고 17일 밝혔다.

미디어젠 컨소시엄은 ‘과학기술정보통신부’가 주관하고 ‘한국지능정보사회진흥원(NIA)’이 추진하는 2023년도 인공지능 학습용 데이터 구축 사업의 ‘초거대 AI 모델’을 위한 인공지능 학습용 데이터 구축 사업자로 최종 선정된 바 있으며, 약 2억 어절이 넘는 초거대 규모 헬스케어 분야 생성형 AI 챗봇 질의응답 데이터를 구축 완료했다.

이번 사업은 AI 최신 기술인 초거대 AI 언어 모델 및 응용 서비스 개발에 필수적인 대량의 말뭉치 데이터를 구축하는 것으로, 실제 일반인 및 의료진의 질의응답 데이터, 전문 의료 서적 데이터, 증강 데이터 등으로 구성됐다.

미디어젠 컨소시엄은 메트릭스, 비디, 위뉴, 메인 등 5개 전문 기업으로 구성돼 있으며 이번에 구축된 데이터에 대해 통계적 다양성, 구문 정확성, 의미 정확성, 유사성 등에 대해 진행된 TTA의 정밀 검증에서 모두 합격 판정을 받았다.

특히 초거대 언어 모델 성능을 평가하는 TTA의 유효성 검증에서 챗봇의 답변 성공률에 대한 생성 모델 비교 평가 결과 ROUGE-1, ROUGE-2 기준을 모두 달성함으로써, AI 학습용 데이터의 안정성은 물론 초거대 언어 모델의 성능도 공식적 입증도 받게 됐다.

이번 TTA 검증에 활용된 데이터는 일반인의 질문 데이터와 의료진이 직접 작성한 헬스케어 데이터가 질의응답 쌍을 이루고 있으며, 직접 수집된 데이터를 기반으로 증강됐다.

데이터 증강에는 Polyglot을 기반으로 미디어젠이 직접 개발한 증강 모델이 활용됐으며, 초거대 AI 질의응답 모델은 한국전자통신연구원(ETRI)의 T5 기반 파인 튜닝 모델로 시험을 진행했다.

이번 사업을 총괄하고 있는 미디어젠의 송민규 상무는 “초거대 AI 모델의 최적 성능 확보를 위한 증강 데이터와 생성형 질의응답 모델이 TTA 성능 검증을 통과한 것에 매우 기쁘다”면서 “각 산업 영역에서 직접적으로 활용될 수 있는 사업화 초거대 언어 모델을 꾸준히 발표할 예정”이라고 밝혔다.

한편, 초거대 AI 모델 학습을 위한 헬스케어 질의응답 데이터 구축은 2023년 12월 말까지 데이터 수집 및 AI 모델 검증이 완료됐으며, 2024년 상반기 한국지능정보사회진흥원이 운영하는 AI-Hub를 통해 모든 데이터가 일반에 공개될 예정이다.

CWN 이성호 기자

sunghho@cwn.kr

[저작권자ⓒ CWN(CHANGE WITH NEWS). 무단전재-재배포 금지]

이성호 기자
이성호 기자 / 뉴미디어국 부국장 주요 이슈를 담당하고 있습니다.
기자 페이지

최신기사

뉴스댓글 >

- 띄어 쓰기를 포함하여 250자 이내로 써주세요.
- 건전한 토론문화를 위해, 타인에게 불쾌감을 주는 욕설/비방/허위/명예훼손/도배 등의 댓글은 표시가 제한됩니다.

댓글 0

Today

Hot Issue