"고난도 추론·수학에 강점" GPT-6 아스트라 성능 따져보니…가격도 2.5배↑ 작성일 09-04 52 목록 <div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">오픈AI, GPT-6 아스트라 공개<br>코딩·컴퓨터 사용 앞세워 기업용 AI 승부<br>비용 효율은 과제</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="16hfJme4cT"> <div contents-hash="07da9b9a9dd9f937587c8a09fc619def07cc2cb065e3f234488801b312cac66b" dmcf-pid="tPl4isd8ov" dmcf-ptype="general"> <p>오픈AI가 차세대 최상위(프런티어) 모델 GPT-6 아스트라를 공개했다. 코딩과 컴퓨터 사용력을 앞세워 기업용 AI 시장의 선도 지위를 다지는 행보지만, 토큰 가격이 오른 만큼 비용 효율이 낮아졌다는 분석도 나온다.</p> </div> <figure class="figure_frm origin_fig" contents-hash="a640acd454fcb11028765b1c7791e58b06d0042174e748140e242b0874bead8f" dmcf-pid="FQS8nOJ6jS" dmcf-ptype="figure"> <p class="link_figure"><img class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202609/04/akn/20260904153750651ivcl.png" data-org-width="745" dmcf-mid="5xv6LIiPNy" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202609/04/akn/20260904153750651ivcl.png" width="658"></p> </figure> <div contents-hash="cf986cc4a5899fbed43afce3a670055187398cfccdae88e6f10f056574a9fc91" dmcf-pid="3xv6LIiPcl" dmcf-ptype="general"> <p>오픈AI는 4일 GPT-6 아스트라를 공개하고 "추론, 컴퓨터 사용, 소프트웨어 개발, 사이버보안, 과학 등 다양한 영역에서 최고 수준의 성능을 보이는 프런티어 모델"이라고 소개했다.</p> </div> <p contents-hash="c479f4c88920ae83aa7fb76e8738aa7cfee39a865a27320fd2f653b65831e72a" dmcf-pid="0MTPoCnQch" dmcf-ptype="general">아스트라는 고난도 추론과 수학에서 강점을 보였다. 추상 추론 평가(ARC-AGI-3)에서 최대 99.9%를 기록해 전작 GPT-5.6 솔의 7.8%를 크게 웃돌았다. 고난도 수학 평가 (프런티어매스 티어 4)에서 97.6%를 기록하며 전작(83%)보다 높았다.</p> <p contents-hash="d7b28b2bc068445b3eadd6d78ecb4f0b931f9d035deaad81249dd537b3651754" dmcf-pid="pRyQghLxaC" dmcf-ptype="general">코딩 영역에서도 성능이 향상됐다. 여러 단계로 이뤄진 개발 작업을 평가하는 터미널 벤치 4.0에서는 57.9%의 성능을, 실제 소프트웨어 엔지니어링 역량을 평가하는 벤치마크(DeepSWE v1.1)에서는 74.1%를 기록했다.</p> <p contents-hash="d4dcffa8f037a3bb4549a31e04927617935d13634123bb7d282bc3b4fd1cdc6f" dmcf-pid="UeWxaloMoI" dmcf-ptype="general">이번 모델의 핵심은 AI가 답변 생성을 넘어 화면과 외부 도구를 직접 다루며 여러 단계의 업무를 이어서 처리한다는 점이다. 운영체제를 사람처럼 조작하는지를 평가하는 벤치마크(OSWorld 2.0) 평가에서 72.6%를 기록해 GPT-5.6 솔의 65.7%를 넘어섰으며, 지연시간을 반영한 시뮬레이션에서는 작업 완료에 걸리는 시간도 약 47% 줄었다.</p> <p contents-hash="415883ba934348ecacfbfe10facc6713b1bfe29c23a1daeb998b0033dc7dce3a" dmcf-pid="udYMNSgRkO" dmcf-ptype="general">아스트라는 일부 조직을 대상으로 우선 제공되며, 향후 며칠에 걸쳐 챗GPT 플러스·프로·비즈니스·엔터프라이즈 사용자와 오픈AI API 및 AWS로 제공 범위를 확대한다.</p> <p contents-hash="3dde1ecb8c2ccb7512e96de1a255e5e5bc46b18d0a13856e8a8b24a650848307" dmcf-pid="7JGRjvaeos" dmcf-ptype="general">성능뿐 아니라 가격도 올랐다. 아스트라의 API 표준 가격은 입력 토큰 100만개당 10달러, 출력 토큰 100만개당 50달러로, 전작 GPT-5.6 솔보다 2.5배 높다. 복잡한 추론과 장시간 업무 수행이 필요한 업무용 모델로 아스트라를 내세운 것으로 풀이된다.</p> <p contents-hash="309071769a601eeea981fa1d7ced69ea4bfd590740e8975afa34d854b00d2dbf" dmcf-pid="ziHeATNdcm" dmcf-ptype="general">그렉 브록먼 오픈AI 사장은 "몇 년 뒤 범용인공지능(AGI)이 언제 만들어졌는지를 돌아본다면 이 시점, 이 모델일 수 있다"고 말했다.</p> <p contents-hash="270cfad269514055eeaa4ffff57023a36f75d9f75187350699558ed0ce967e5e" dmcf-pid="qnXdcyjJjr" dmcf-ptype="general">다만 독립 분석기관 아티피셜 애널리시스는 아스트라가 코딩 에이전트 성능과 토큰 효율은 개선됐지만, 종합 지능 지표에서는 전작과 큰 차이가 없었고 API 인상 탓에 일반 작업 비용 효율은 오히려 낮아졌다고 분석했다.</p> <p contents-hash="2545a66625d7bfb483608f1dfe0a779f6e479aafb26699d333953f1609775318" dmcf-pid="BfO9RDx2Aw" dmcf-ptype="general">주요 외신들은 기업용 AI 시장에서 존재감을 키운 앤스로픽에 대항해 소프트웨어 개발과 전문 업무 수행력을 내세웠다고 분석했다. 영국 파이낸셜타임스(FT)는 오픈AI가 앤스로픽에 내줬던 기술 주도권을 되찾고, 기업공개(IPO)를 앞두고 기업용 AI 시장 선도 지위를 재확인하려는 행보로 평가했다. </p> <p contents-hash="52b7b6a1c9989a1e5be007aae6ac059b338f26a61e6ca4353649d807b283766b" dmcf-pid="b4I2ewMVoD" dmcf-ptype="general">이은서 기자 libro@asiae.co.kr</p> </section> </div> <p class="" data-translation="true">Copyright © 아시아경제. 무단전재 및 재배포 금지.</p> 관련자료 이전 모두의AI가 꺼낸 승부수는 ‘韓 생활데이터’…외산 AI 넘을수 있을까 [종합] 09-04 다음 [AI프리즘] '모두의 AI' 뜯어보니…SKT·KT·카카오 승부수 달랐다 09-04 댓글 0 등록된 댓글이 없습니다. 로그인한 회원만 댓글 등록이 가능합니다.