로그인
보증업체
스포츠중계
스포츠분석
먹튀사이트
지식/노하우
판매의뢰
업체홍보/구인
뉴스
커뮤니티
포토
포인트
보증카지노
보증토토
보증홀덤
스포츠 중계
기타
축구
야구
농구
배구
하키
미식축구
카지노 먹튀
토토 먹튀
먹튀제보
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
제작판매
제작의뢰
게임
구인
구직
총판
제작업체홍보
실시간뉴스
스포츠뉴스
연예뉴스
IT뉴스
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[실시간뉴스]
“윤석열이 만약 그의 출금을 알았더라면”···‘이종섭 호주도피’ 1심 무죄 만든 세 가지[판결 돋보기]
N
[실시간뉴스]
靑 "李대통령, 트럼프 중동 협조 요청 거절한 것 아냐"
N
[실시간뉴스]
김정은, 사흘간 군수공장 시찰…신형 드론·방사포 현장 공개(종합)
N
[IT뉴스]
[게임위드인] K게임의 도쿄게임쇼 키워드는…모바일·서브컬처
N
[IT뉴스]
[AI는 지금] AI 투자, 오픈AI·앤트로픽에 몰렸다…韓도 상위 10곳에 74.5% 쏠려
N
커뮤니티
더보기
[자유게시판]
드디어 금요일이군요
[자유게시판]
오늘 다저스 어떻게 생각하시나요
[자유게시판]
하아 댓노
[자유게시판]
식곤증지립니다요
[자유게시판]
벌써 불금이네요
목록
글쓰기
[IT뉴스]아스트라가 99.9점 받았다는 ‘인간 vs AI 판별 시험’
온카뱅크관리자
조회:
8
2026-09-19 10:27:25
<div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">[IT백과] 데이터 활용 방식에 따라 달라지는 점수…벤치마크 창시자 평가는 ‘62.7점’</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="1GpK8gRfTu"> <div contents-hash="04c8ce408baacffeec5fd818c2f45aae800837cce3676f32a45bdd965de74939" dmcf-pid="tHU96ae4hU" dmcf-ptype="general"> <strong>정보기술(IT) 영역에 관한 모든 지식을 압축해 풀이합니다. IT산업에 꼭 필요한 용어들을 소개하고, 살펴보면 좋을 쟁점들도 정리합니다. IT가 처음인 입문자라면 혹은 동향을 알고 싶은 전문가라면, 디지털데일리 'IT백과'를 참고하세요. <편집자주></strong> </div> <figure class="figure_frm origin_fig" contents-hash="b1f2521ad308b67da7cca4eead16b53fae57485366d297d87a02653bbc2b9538" dmcf-pid="FXu2PNd8Wp" dmcf-ptype="figure"> <p class="link_figure"><img class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202609/19/552796-pzfp7fF/20260919101954016biqg.png" data-org-width="640" dmcf-mid="5QH0qMV7l7" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202609/19/552796-pzfp7fF/20260919101954016biqg.png" width="658"></p> </figure> <p contents-hash="25f5b02805b291cea6b7a14c9babb9ea2411f696b56e6480dd6023fc1e9591c8" dmcf-pid="3Z7VQjJ6C0" dmcf-ptype="general">[디지털데일리 오병훈기자] <strong>#인공지능(AI)에게 아무런 설명 없이 처음 보는 게임을 제시한다. 무엇을 해야 점수를 받고 승리할 수 있는지 알려주지도 않는다. AI는 버튼을 눌러보고, 실패하고, 화면 변화를 관찰하면서 스스로 규칙과 목표를 찾아야 한다.</strong></p> <p contents-hash="b2eedf9dcf8bc4803d5e5080eeaff33f371eb0b342daef668c6309e90ecf138b" dmcf-pid="05zfxAiPv3" dmcf-ptype="general">지난 3일(현지시간) 공개된 오픈AI 최신 모델 GPT-6 아스트라(Astra)가 이 같은 시험에서 99.9%라는 점수를 기록했다. 시험 이름은 ‘아크(ARC)-AGI-3'다. 오픈AI는 해당 점수 결과를 강조하면서 아스트라가 인간 지능에 버금가는 범용인공지능(AGI)에 한발 더 다가섰다고 대대적으로 홍보하고 나섰다.</p> <p contents-hash="5bbc190c690ccfb958dcd385f9d473a837675f4334d4c8c8f9f52db952f3a068" dmcf-pid="p1q4McnQWF" dmcf-ptype="general">아크 AGI는 흔히 ‘AI용 IQ 테스트’처럼 소개되지만 엄밀히 말하면 조금 다르다. AI가 얼마나 많은 지식을 알고 있는지를 보는 테스트가 아니다. AI가 그동안 경험하지 못한 문제를 접했을 때 규칙을 얼마나 효율적으로 배워 해결하는지를 측정하려는 시험이다.</p> <p contents-hash="0885ff293d377465c65353881f948d068cf05c926877af1a7e1555accc0acd9e" dmcf-pid="UtB8RkLxTt" dmcf-ptype="general">아크 AGI의 시작은 구글 연구원 출신 AI 연구자 프랑수아 숄레가 처음으로 제안한 벤치마크다. 지난 2019년 논문 ‘지능의 측정에 관해(On the Measure of Intelligence)’에서 ‘추상 추론 코퍼스(Abstraction and Reasoning Corpus, ARC)’를 처음 제시했다. 현재 ARC-AGI-1로 불리는 벤치마크의 원형이다.</p> <p contents-hash="659a367cc26289f6d9b29a1cbfa291880f713e6b789260bd09c72e6c0e6a91be" dmcf-pid="uFb6eEoMl1" dmcf-ptype="general">숄레의 구상이 현재 아크프라이즈재단으로 이어지는 체계가 만들어진 것은 지난 2024년부터다. 숄레는 기업가 마이크 눕(Mike Knoop)과 함께 ‘아크프라이즈(ARC Prize) 2024’ 대회를 출범시켰다. 이듬해인 2025년 이를 오픈소스 AGI 연구를 지원하는 비영리 아크프라이즈재단으로 확대했다.</p> <p contents-hash="6a24757055d3f746e28e8c67506b3e69454fae73fe17e110f201a6315c076f4b" dmcf-pid="7Z7VQjJ6T5" dmcf-ptype="general">이 모든 흐름의 출발점에는 ‘무엇을 지능이라고 부를 것인가’라는 숄레의 문제의식이 있다. 그는 기존 AI 벤치마크가 특정 과제에서 얼마나 높은 숙련도를 보이는지에 치우쳐 있어, 새로운 문제를 배우고 일반화하는 능력을 제대로 측정하지 못한다고 봤다.</p> <p contents-hash="328bdff9041c1d6466981fa9b23d6c854ef25c347b015e495fc030e309642215" dmcf-pid="z5zfxAiPCZ" dmcf-ptype="general">아크 AGI는 시간 흐름에 따라 3단 진화를 거쳤다. 먼저 아크 AGI-1에서는 여러색으로 구성된 작은 격자의 입력과 출력 예시 몇 개를 보여준 뒤 새로운 입력의 정답을 맞히도록 한다.</p> <p contents-hash="321ebff27171d2744aef9c7711d9b70e54609ecb6088a66e711c623b300664ee" dmcf-pid="q1q4McnQlX" dmcf-ptype="general">예컨대 앞선 예시들을 보고 같은 모양을 찾아 이동한다거나 특정 색으로 둘러싸인 영역만 남긴다와 같은 규칙을 스스로 추론해야 한다. 자연어 지식이나 역사 상식, 외운 공식으로 풀기 어렵다는 특징을 가지고 있다. 처음 보는 사례에서 추상적인 규칙을 뽑아내는 것이 핵심이다.</p> <p contents-hash="bc9967327fc99197428311304180bb3b2931e12c5fa13c8697d88677f4478b49" dmcf-pid="BtB8RkLxWH" dmcf-ptype="general">그 결과 아크 AGI는 한동안 대형언어모델(LLM)에 상당히 어려운 시험이었다. 재단에 따르면 GPT-3가 등장한 2020년부터 GPT-4o가 나온 2024년까지 아크 AGI-1 점수는 0%에서 약 5%로 오르는 데 그쳤다.</p> <p contents-hash="a607da26c4c023bfb288db263138b96bcf6a210b298ee0b9162886a44ca9d562" dmcf-pid="bFb6eEoMSG" dmcf-ptype="general">전환점은 2024년 말 오픈AI 추론 모델 ‘o3’ 프리뷰 버전이었다. 재단의 준공개(Semi-Private) 평가에서 제한된 연산 설정으로 75.7%, 대규모 연산을 사용한 설정에서는 87.5%까지 올라갔다.</p> <p contents-hash="dc3551d6f822b10e8180806be563cd711f6a7979a3b9aff1ddf6f80c933e09d6" dmcf-pid="K3KPdDgRTY" dmcf-ptype="general">AI가 차츰 문제를 풀기 시작하자 시험도 진화했다. 2025년에는 아크 AGI-2가 등장했다. 외형은 여전히 색깔 격자를 이용한 퍼즐이지만 단순한 패턴 인식을 넘어 기호의 의미를 문맥에 따라 해석하거나 여러 규칙을 조합해야 풀 수 있는 문제가 강화됐다.</p> <p contents-hash="f9630808f3ba1d8dd6515a2bdd8e0c8e63a2dc480be05608de5a1dcf6eeed086" dmcf-pid="909QJwaelW" dmcf-ptype="general">아크 AGI의 원칙은 사람이 풀 수 있는 문제여야 한다는 것이다. 재단은 아크 AGI-2 개발 과정에서 400명을 대상으로 1400개가 넘는 문제를 시험했다. 각 문제는 적어도 두명 사람이 두 번 이하의 시도 안에 해결한 경우에만 포함됐다. 사람이 풀 수 있지만 AI에는 어려운 문제를 골라낸 셈이다.</p> <p contents-hash="70cff1a6130806ea87f96ae7b1f316c990cbce6674fd9791f4ca9f6670fb63e5" dmcf-pid="2p2xirNdTy" dmcf-ptype="general">실제로 아크 AGI-2 공개 당시 주요 AI 모델의 점수는 다시 한 자릿수대로 떨어졌다. 재단은 당시 최고 수준 모델들도 5%를 넘지 못했다고 설명했다.</p> <p contents-hash="736e93cb2e7967c41b163ae650e282d2cb5cc3a5551a6bfad8cae40edeb62628" dmcf-pid="VUVMnmjJlT" dmcf-ptype="general">올해 등장한 아크 AGI-3에서는 시험 방식 자체가 바뀌었다. 앞서 1과 2 버전이 주어진 입력과 출력에서 규칙을 찾아내는 정적인 문제였다면 아크 AGI-3는 AI가 환경과 직접 상호작용한다. 게임과 비슷한 추상적인 환경을 보여준 뒤 별도의 자연어 설명 없이 행동하게 한다.</p> <p contents-hash="bfdcd0119ddc3f60482852d9f938b16d1c1f37d80f0706448d0962e1e1917a1b" dmcf-pid="fufRLsAivv" dmcf-ptype="general">AI는 직접 움직여보면서 무엇이 바뀌는지 살펴보고, 환경의 작동 원리를 추론하고, 자신이 달성해야 할 목표가 무엇인지 찾아낸 뒤 행동 계획까지 세워야 한다.</p> <p contents-hash="9dfc6feb24ca5f6e7f9f87aa9b0688b81ea2d8cefcb24b2104af4cd4cf10b965" dmcf-pid="4LDhWu5TTS" dmcf-ptype="general">재단은 이를 ▲탐색(Exploration) ▲모델링(Modeling) ▲목표 설정(Goal-setting) ▲계획·실행(Planning and Execution) 능력을 평가하는 시험으로 설명한다. 약 500명이 참가한 별도 인간 평가 데이터도 구축했으며 각 환경은 사람이 해결할 수 있는지 확인하는 과정을 거쳤다.</p> <p contents-hash="f9603519f2fc12d985de4f8e9bd52b2cff6b776ab2d39606e32fb5dab59e8502" dmcf-pid="8owlY71yWl" dmcf-ptype="general">쉽게 말해 아크 AGI-1과 2가 처음 보는 문제의 규칙을 찾는 것이었다면 아크 AGI-3는 처음 보는 세상에 들어가 무엇을 해야 할지부터 알아내는 테스트에 가깝다. LLM에서 추론 모델, 다시 에이전트로 AI 기술의 관심사가 이동한 흐름이 벤치마크에도 그대로 반영되고 있는 셈이다.</p> <p contents-hash="13e343fc09e0813375d4ad743baa151c3161cbe9f29192c59ece97b1cc00c864" dmcf-pid="6grSGztWCh" dmcf-ptype="general">물론 아크 AGI 평가 한계를 지적하는 시선도 적지 않다. 재단이 실시한 독립 검증에 따르면 아스트라는 재단 표준 방식(모델이 스스로 남길 메모를 고르는 방식)에서는 62.7%를 기록했다. 추론 상태를 요청 사이에 보존·압축해주는 ‘프로바이더 어댑터’ 방식에서는 99.9%를 기록했다.</p> <p contents-hash="f11509c83a8240caf2af774e099a0041b1e1a54c8e3faf99f0e0c0b06a896899" dmcf-pid="PamvHqFYlC" dmcf-ptype="general">평가 방법에 따라 점수가 바뀔 수도 있다는 의미다. 초기에 회자된 98.6%는 후자 방식의 최대 추론 설정 점수(98.55%)다. 오픈AI 공식 발표 페이지는 설정별 최고치를 골라 99.9%를 내세웠다.</p> <p contents-hash="8df796cfd2dd5afe8acbcca4ca36411a0d6fafe7628626d1633605d5f94ce62e" dmcf-pid="QNsTXB3GTI" dmcf-ptype="general">같은 모델이라도 주변 인프라 구성에 따라 37%포인트가 출렁인 셈이다. 만점급 점수조차 결국 준비된 에이전트 시스템을 측정한 것이며 추론 방식이 바뀌면 AI의 역량도 달라진다는 지적도 나온다.</p> <p contents-hash="1dd97528d6a24a0014181364095b605d539ce785e6db46e49901cde8597564d3" dmcf-pid="xjOyZb0HCO" dmcf-ptype="general">아크 AGI를 만든 숄레 역시 아스트라 성능을 높게 평가했다. 그는 지난 3일 자신의 X에 아스트라를 두고 “상호작용형 추론 문제에서 모델 역량의 계단식 변화”라고 평가했다. 특히 게임마다 규칙을 즉석에서 기호화하고 자체적인 축약 표현까지 만들어내는 모습에 주목하며 아스트라를 모델 지능 측면에서 중요한 돌파구로 봤다.</p> <p contents-hash="d2e4f75c93ea1fc5e11e49d54a7236bda259605ea380d8203e1e99a253db104f" dmcf-pid="yp2xirNdWs" dmcf-ptype="general">테스트 창시자인 숄레도 아크 AGI 고득점을 AGI 달성과 동일시하는 데에는 선을 그었다.</p> <p contents-hash="98f97f88374c73e6b2452bec74cc86d6ad05d14448d5963c2eb903bc62a14715" dmcf-pid="WUVMnmjJhm" dmcf-ptype="general">숄레는 지난 9일 자신의 소셜미디어에 “아크 AGI-3를 푸는 것이 AGI의 증거는 아니며 이 테스트가 결승선으로 만들어진 것도 아니다”라며 “우리가 지금까지 이 시스템에 대해 아는 것은 벤치마크 점수뿐”이라고 말했다.</p> <p contents-hash="d6a4fbaeb5201815941cedfa71e484f166ff6901438726abd5a733de4499abd8" dmcf-pid="YufRLsAiCr" dmcf-ptype="general">새로운 시험도 준비 중이다. 숄레는 현재 새로운 버전 시험인 ‘아크 AGI-4’를 개발 중이며 2027년 1분기 공개할 계획이라고 밝혔다. AI가 인간에게 쉽고 자신에게 어려웠던 문제 하나를 정복할 때마다 다시 남아 있는 격차를 찾아 새로운 시험을 만드는 셈이다. 정리해보면 아크 AGI가 보여주는 것은 어느 한 시점의 ‘AGI 합격증’보다는 인간과 AI 사이 남아 있는 지능의 간극이 얼마나 빠르게 좁혀지고 있는지에 더 가깝다는 것이 업계 평가다.</p> </section> </div> <p class="" data-translation="true">Copyright © 디지털데일리. All rights reserved. 무단 전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기