국가대표 AI 5개팀 학습데이터 푼다…1조5600억 토큰 개방 작성일 08-27 31 목록 <div id="layerTranslateNotice" style="display:none;"></div> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="02fkEujJNG"> <p contents-hash="b7e5ec2b391c6c199a0c895495c894bed3bb28cf953a56349bbeed17dd8a0003" dmcf-pid="pV4ED7AicY" dmcf-ptype="general"><br><strong>과기정통부·NIA, AI허브서 무료 배포<br>정예팀 4곳은 검증 통과분 전량 공개</strong></p> <figure class="figure_frm origin_fig" contents-hash="8eeb558cb458898ba3704b85849c153239548ce0128b2686ee49a6ec8f55bce7" dmcf-pid="UJnvT6hDaW" dmcf-ptype="figure"> <p class="link_figure"><img alt="배경훈 부총리 겸 과학기술정보통신부 장관이 지난해 12월 30일 서울 강남구 코엑스에서 열린 '독자 AI 파운데이션 모델 프로젝트 1차 발표회'에 참석해 축사하고 있다. /뉴시스" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/27/THEFACT/20260827145638418aqjl.jpg" data-org-width="640" dmcf-mid="3b2AcpaekH" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/27/THEFACT/20260827145638418aqjl.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 배경훈 부총리 겸 과학기술정보통신부 장관이 지난해 12월 30일 서울 강남구 코엑스에서 열린 '독자 AI 파운데이션 모델 프로젝트 1차 발표회'에 참석해 축사하고 있다. /뉴시스 </figcaption> </figure> <div contents-hash="490fc4cf69d1a0a1ac23f0775faf63a15cd04c9d0c1d965c92595d0066fe8a19" dmcf-pid="uiLTyPlwky" dmcf-ptype="general"> <br>[더팩트|우지수 기자] 과학기술정보통신부와 한국지능정보사회진흥원(NIA)은 독자 인공지능(AI) 파운데이션 모델 프로젝트 정예팀 5곳이 구축한 AI 학습용 데이터 29종을 AI허브에 개방한다고 27일 밝혔다. </div> <p contents-hash="59caeefe1e0e0b093daa62d158a62f26c987bfc863b7de5507a2560f0deadfd8" dmcf-pid="7noyWQSrNT" dmcf-ptype="general">이날 풀리는 데이터는 약 3544만건이다. AI가 문장을 처리하는 최소 단위인 토큰으로 환산하면 1조5600억개 규모로, 매개변수 700억~800억개(70~80B)급 대형 모델을 학습시킬 수 있는 분량이다. 참여팀은 네이버클라우드·업스테이지·SK텔레콤·엔씨에이아이(NC AI)·LG AI연구원이다.</p> <p contents-hash="a089160dd3f825b7edf7ddbd4dfa739f0cd994b6412485d9849c121901923bd0" dmcf-pid="zLgWYxvmgv" dmcf-ptype="general">개방 데이터는 5개 팀이 지난해 정부 예산 150억원을 지원받아 직접 기획·가공한 자산이다. AI의 기초 지식을 쌓는 사전학습 데이터부터 영상·음성을 아우르는 멀티모달 데이터, 유해 답변을 걸러내기 위한 보안·안전성(레드티밍) 데이터까지 포함됐다.</p> <p contents-hash="f4b802bcdf88cd77c09a4e94067ff2ff058f99fb8e17620cd57583f24fa4eb97" dmcf-pid="qoaYGMTsaS" dmcf-ptype="general">팀별로 보면 △네이버클라우드는 공개 영상 234만건과 방송 영상 52만건, 영상클립 기반 텍스트 1550만건, 음성 질의응답 1200만건 △업스테이지는 1조 토큰 규모 사전학습 데이터와 사후학습 데이터 50만건 △SK텔레콤은 수학·과학·법률 등 전문 도메인 다단계 추론 데이터와 한국형 레드티밍 데이터 1만건 △엔씨에이아이는 제조 기술문서와 민원 상담 음성을 활용한 거대언어모델(LLM) 핵심 역량 데이터 7종 △LG AI연구원은 국내 50개 가정에서 50종 이상 가사 활동을 촬영한 영상 클립 17만개 이상을 각각 구축했다.</p> <p contents-hash="5adfdd4a2641ca275933ebb9f7282513ee4bfc173beb4b341e3960ba531144d4" dmcf-pid="BgNGHRyOjl" dmcf-ptype="general">네이버클라우드 데이터에는 장면을 문장 단위로 옮긴 캡션이 담겨 영상 이해와 이미지 생성 모델 학습에 쓸 수 있다. 업스테이지 사후학습 데이터는 추론·판단·실행을 수행하는 AI 에이전트 개발에, LG AI연구원 데이터는 객체·분할·자세·맥락 정보를 다층 라벨링해 비전·시각언어모델(VLM) 연구와 상용 서비스 개발에 활용 가능하다.</p> <p contents-hash="1964d97758adae562b22bacf4eecd0d203dc2840b1d5669663e04301a9ad0a81" dmcf-pid="bajHXeWINh" dmcf-ptype="general">NIA와 한국정보통신기술협회(TTA)는 1차 단계평가가 끝난 뒤 각 팀이 데이터 구축·가공 예산으로 확보한 데이터를 전량 넘겨받았다. 이후 품질검증과 개인정보·유해성 검증을 거쳐 라이선스 제약이 걸린 데이터는 공개 대상에서 뺐다.</p> <p contents-hash="c27fc1b4728d964f17f0878568a5d65a6932b8f006f30a019c0396767daa2bc6" dmcf-pid="KNAXZdYCAC" dmcf-ptype="general">사업 공고상 해당 예산으로 만든 데이터는 50% 이상을 개방해야 한다. 네이버클라우드·업스테이지·SK텔레콤·엔씨에이아이는 검증을 통과한 데이터를 모두 열기로 했고, LG AI연구원은 공개 대상을 통계적으로 선별해 의무 개방량을 채웠다.</p> <p contents-hash="d7a4392208582e5b8c183b404be0ea452e9a67ab8429313b43a5f09aabbc8237" dmcf-pid="9jcZ5JGhNI" dmcf-ptype="general">29종 데이터는 국내 기업과 연구자, 학생 등 누구나 AI허브에서 무료로 내려받을 수 있다. '독자AI모델 데이터' 항목에서 팀별·종류별 검색이 가능하며 일부는 별도 신청 절차를 거쳐야 한다. 과기정통부는 2차 단계평가 과정에서 확보한 데이터도 검증을 마치는 대로 개방할 방침이다.</p> <p contents-hash="2ada6713fdd9cff5cdb4de56430cde27e56bbd9dce24498b5d5be5867d885269" dmcf-pid="2Ak51iHloO" dmcf-ptype="general">김경만 과기정통부 인공지능정책실장은 "오늘 개방된 데이터는 정예팀의 AI 학습 전략이 담긴 귀중한 자산"이라며 "AI 생태계의 성장과 자생력 강화를 이끄는 밑거름이 될 것"이라고 말했다.</p> <p contents-hash="d88e18c09c39a89357f01aef33cbfa3d8a8f15f4c8c72ea68730121854fa3b2c" dmcf-pid="VcE1tnXSgs" dmcf-ptype="general">index@tf.co.kr</p> <p contents-hash="da814f8e0e5d6c5aa6dd0847ef5629903d0fb4c9aa025dffb7f090ecea20a6a6" dmcf-pid="fkDtFLZvam" dmcf-ptype="general"><strong>발로 뛰는 더팩트는 24시간 여러분의 제보를 기다립니다.</strong><br>▶카카오톡: '더팩트제보' 검색<br>▶이메일: jebo@tf.co.kr<br>▶뉴스 홈페이지: http://talk.tf.co.kr/bbs/report/write</p> </section> </div> <p class="" data-translation="true">Copyright © 더팩트. 무단전재 및 재배포 금지.</p> 관련자료 이전 "데이터가 곧 AI 경쟁력"…정부, '독파모 정예팀' 데이터 3544만건 푼다 08-27 다음 올드 IP의 귀환·中 신작 공세… 게임스컴 달군 세대교체 경쟁 08-27 댓글 0 등록된 댓글이 없습니다. 로그인한 회원만 댓글 등록이 가능합니다.