로그인
보증업체
스포츠중계
스포츠분석
먹튀사이트
지식/노하우
판매의뢰
업체홍보/구인
뉴스
커뮤니티
포토
포인트
보증카지노
보증토토
보증홀덤
스포츠 중계
기타
축구
야구
농구
배구
하키
미식축구
카지노 먹튀
토토 먹튀
먹튀제보
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
제작판매
제작의뢰
게임
구인
구직
총판
제작업체홍보
실시간뉴스
스포츠뉴스
연예뉴스
IT뉴스
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[실시간뉴스]
유시민 "李 대통령, 오만한 권력자 모습…집권 연합 스스로 해체 중"
N
[실시간뉴스]
태풍 3개 북상하지만…우리나라는 찜통 폭염
N
[실시간뉴스]
SK하이닉스 임단협 잡정합의안 부결…'성과급 60% 주식' 재협상
N
[실시간뉴스]
美반도체 찬바람·삼전닉스 약세 지속…코스피 2~3%대 하락(종합)
N
[실시간뉴스]
실종 사건 '거짓 종결' 경찰관, 불구속 상태서 오늘 구속영장 심사
N
커뮤니티
더보기
[자유게시판]
드디어 금요일이군요
[자유게시판]
오늘 다저스 어떻게 생각하시나요
[자유게시판]
하아 댓노
[자유게시판]
식곤증지립니다요
[자유게시판]
벌써 불금이네요
목록
글쓰기
[IT뉴스]‘전문가 선택’ 흔들림 줄인다…노타, EMNLP 2026서 MoE 양자화 논문 2편 채택
온카뱅크관리자
조회:
3
2026-08-25 09:07:25
<div id="layerTranslateNotice" style="display:none;"></div> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="3iNkJ5J6WT"> <div contents-hash="fc5d87d78107535a3829090a0d9459ce250ea2cd72431a2b7c80cd0a12336e5a" dmcf-pid="0njEi1iPhv" dmcf-ptype="general"> <h5>메인 컨퍼런스·파인딩스 각 1편…초거대 AI 모델의 양자화 이후 성능 저하 문제 다뤄</h5> <h5>‘MENDS-MoE’는 전문가 순서 보존, ‘OPERA’는 답변에 영향 주는 변화에 최적화 집중</h5> <h5>Qwen3.8-Max 구동 GPU 24장에서 4장으로…데이터센터 AI까지 적용 범위 확대</h5> <div> </div> </div> <figure class="figure_frm origin_fig" contents-hash="bbb28127384a321973c5b2e296a2e1199e92cbc8eeb27492defdb63c198314a7" dmcf-pid="pRLNMGMVSS" dmcf-ptype="figure"> <p class="link_figure"><img alt="노타는 ‘EMNLP 2026’에서 초거대 AI 모델 최적화 연구 논문 2편이 각각 메인 컨퍼런스와 파인딩스(Findings)에 채택됐다고 25일 밝혔다." class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/25/552816-OGTrtXj/20260825090659137mzjt.jpg" data-org-width="1024" dmcf-mid="FIpzZLZvvy" dmcf-mtype="image" height="auto" src="https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/25/552816-OGTrtXj/20260825090659137mzjt.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 노타는 ‘EMNLP 2026’에서 초거대 AI 모델 최적화 연구 논문 2편이 각각 메인 컨퍼런스와 파인딩스(Findings)에 채택됐다고 25일 밝혔다. </figcaption> </figure> <div contents-hash="bc5257331c0ea1386c5d07525a5cf1ed36bf94371bdd3122fe6ff4b5df167384" dmcf-pid="UeojRHRfvl" dmcf-ptype="general"> <div> </div> </div> <p contents-hash="4dd47c7f4646d1a49dd00eb0f5d8da7ed20f179c0ca960d83e5bd56e6970eeac" dmcf-pid="udgAeXe4vh" dmcf-ptype="general">초거대 언어모델(LLM)을 실제 서비스에 적용하려면 모델 성능뿐 아니라 이를 구동하는 데 필요한 그래픽처리장치(GPU)와 메모리 부담도 함께 해결해야 한다. 최근 확산하는 전문가 혼합(Mixture of Experts, MoE) 구조는 입력에 필요한 일부 ‘전문가’만 선택해 연산하지만, 모델 전체를 메모리에 올려야 한다는 부담은 남는다. </p> <p contents-hash="b81fbf0f7b580e248d580529c5a289030fd4f50ea1d430d94abb25e1e4b85629" dmcf-pid="7JacdZd8hC" dmcf-ptype="general">모델의 메모리 사용량을 줄이는 양자화 과정에서도 문제가 발생할 수 있다. 수치가 조금만 달라져도 MoE가 원래와 다른 전문가를 선택하면서 답변 품질이 낮아질 수 있기 때문이다. AI 모델 경량화·최적화 기업 노타가 이러한 전문가 선택 변화를 줄이는 연구로 자연어처리 분야 주요 국제 학술대회에 이름을 올렸다. </p> <p contents-hash="cb95733a1e481b3db03e31de49696e4ba2909c2d98319a074d4b01cc33a06fa2" dmcf-pid="ziNkJ5J6CI" dmcf-ptype="general">노타는 ‘EMNLP 2026’에서 초거대 AI 모델 최적화 연구 논문 2편이 각각 메인 컨퍼런스와 파인딩스(Findings)에 채택됐다고 25일 밝혔다. 노타에 따르면 올해 대회에는 약 1만8000편의 논문이 제출됐으며 메인 컨퍼런스 채택률은 15.4%였다. </p> <p contents-hash="04895c6d0a05cc4b935f99f2bbf2bab471ce51c1c4dc03128d9970398194b1d8" dmcf-pid="qnjEi1iPTO" dmcf-ptype="general"><strong>양자화 뒤 달라지는 ‘전문가 선택’에 주목</strong> </p> <p contents-hash="6253a4d1d490d02a126bba14a5bc0cdae49d7667dd3f6269a815e210ad86f5e1" dmcf-pid="BLADntnQvs" dmcf-ptype="general">이번 연구의 핵심은 양자화 전후에 MoE 모델이 선택하는 전문가가 달라지는 현상을 줄이는 것이다. MoE는 하나의 거대한 모델이 모든 연산을 처리하는 대신, 입력에 따라 필요한 전문가 일부를 골라 사용한다. GPT 계열을 비롯해 큐웬(Qwen), 키미(Kimi) 등 최신 대형 모델에 이 구조가 빠르게 도입되고 있다. </p> <p contents-hash="9c2f99fcfa2277fc9dc08c39f3922eaf9703aac0f3f318668cf71e36daca0ebc" dmcf-pid="bocwLFLxTm" dmcf-ptype="general">MoE는 실제 연산에 참여하는 전문가 수를 제한할 수 있지만 전체 전문가를 메모리에 저장해야 한다. 양자화를 적용하면 이 부담을 줄일 수 있지만, 모델 내부의 미세한 수치 변화가 전문가 선택 결과까지 바꾸면 기존 답변 성능을 유지하기 어려워진다. </p> <p contents-hash="cff1f7185ee1ceff2747e8c6dd8bd7b0255dca63aedcbb3a66d3cfd6e64b1d91" dmcf-pid="K8Ri4S4qSr" dmcf-ptype="general">메인 컨퍼런스에 채택된 연구는 이러한 변화가 다음 단계의 전문가 선택에 미치는 영향까지 고려한 ‘MENDS-MoE’ 방법론을 제시했다. 선택 여부가 갈릴 수 있는 경계에 놓인 전문가들의 순서를 양자화 이후에도 보존하도록 설계한 것이 특징이다. </p> <p contents-hash="024a5c32415a247d959bd36eabdf067557d494502c3531b976de0d1550956f54" dmcf-pid="96en8v8BTw" dmcf-ptype="general">노타는 3종의 MoE 모델에 4비트와 3비트 양자화를 적용해 실험한 결과, 대부분의 평가 환경에서 비교 기술보다 높은 평균 정확도와 언어모델 성능을 기록했다고 설명했다. </p> <p contents-hash="ede85d1224d3f006b326772a4c6d67313ea070c6f76b102b714396811767ea2d" dmcf-pid="2PdL6T6bvD" dmcf-ptype="general">파인딩스에 채택된 논문은 양자화로 발생한 모든 전문가 선택 변화를 같은 방식으로 보정하지 않는 접근법을 택했다. ‘오페라(OPERA)’로 명명된 이 방법론은 최종 답변에 영향을 주는 변화에 최적화 역량을 우선 배분한다. </p> <p contents-hash="4b4a3f2f96d6ce86be78fab5eb2c540a96727c774d24921fe0ddd1a02875645b" dmcf-pid="VQJoPyPKyE" dmcf-ptype="general">MENDS-MoE가 전문가의 선택 순서와 경계를 유지하는 데 초점을 맞췄다면, OPERA는 제한된 최적화 자원을 답변 품질과 직결되는 변화에 집중한다. 두 연구는 접근 방식은 다르지만 양자화 이후에도 중요한 전문가가 선택되도록 해 모델 품질 저하를 줄인다는 공통점을 갖는다. </p> <p contents-hash="678e8d19cb0c68fb83ddd716b1678a2b8d04177279ec8fd2f7353c47548a3162" dmcf-pid="fxigQWQ9lk" dmcf-ptype="general">노타는 지난달 열린 국제머신러닝학회(ICML) 2026의 ‘자원 적응형 파운데이션 모델 추론(AdaptFM)’ 워크숍에서도 관련 연구 성과를 공개했다. 당시 ‘Efficient Qwen Competition’에서 약 40개 참가팀 가운데 3위를 차지했으며, MoE 양자화 연구 논문 2편도 워크숍에 채택됐다. </p> <p contents-hash="d2ef4ab254302175e02ce10d9f8b696f5ee011b7a464f4174db8a9bdfd0f7df5" dmcf-pid="4MnaxYx2Tc" dmcf-ptype="general">경진대회에서는 오픈소스 LLM ‘Qwen3.5-4B’를 엔비디아 A10G GPU 한 장에서 구동했다. 노타는 모델 성능을 유지하면서 기존보다 평균 6.978배 빠른 추론 속도를 구현했다고 밝혔다. 이번 EMNLP 채택 논문은 ICML 워크숍에서 선보였던 연구를 추가 실험과 분석을 통해 발전시킨 결과다. </p> <p contents-hash="3b66550bc0d1952d9d80b76f9c9528bb0d1d7883386d09b15e008b873215dd3c" dmcf-pid="8RLNMGMVyA" dmcf-ptype="general"><strong>모바일·엣지 넘어 초대형 모델과 데이터센터로</strong> </p> <p contents-hash="d5c389e9629af9c9317ca61b1a43bfa029f979792e5813b91a73567f5c48e91e" dmcf-pid="6eojRHRfhj" dmcf-ptype="general">노타는 그동안 프루닝과 양자화 원천기술을 비롯해 모바일 엣지 AI, 생성형 AI, 비전언어모델(VLM), LLM 분야에서 50여건의 연구 결과를 국내외 학회와 학술지에 발표했다. </p> <p contents-hash="666f86b06df8058fcda3aa65a149f3efccc8d879ac495022876a1b1c9883ce66" dmcf-pid="PdgAeXe4WN" dmcf-ptype="general">최근에는 모델 최적화 기술의 적용 대상을 모바일과 엣지 기기에서 초대형 LLM과 데이터센터 AI 인프라로 넓히고 있다. 모델 규모가 수천억개에서 수조개의 매개변수로 커지면서 성능을 유지한 채 GPU와 메모리 사용량을 줄이는 기술이 서비스 운영 효율과 직결되고 있기 때문이다. </p> <p contents-hash="984cbc995ffb3252414f62566aa50505e93308bd8cb8d0e9cc75397862d6586c" dmcf-pid="QnjEi1iPWa" dmcf-ptype="general">노타가 공개한 최적화 결과에 따르면 1조개가 넘는 매개변수를 보유한 ‘Qwen3.8-Max’는 구동에 필요한 엔비디아 B300 GPU 수가 24장에서 4장으로 줄었다. 문샷AI의 ‘Kimi K3’는 B300 GPU 8장에서 최대 4장으로, 업스테이지의 ‘Solar Open 2’는 H100 GPU 8장에서 2장으로 각각 축소했다. </p> <p contents-hash="e819a3dfa61147b6801247bdedbf45ddfbd7ec9e69fc41da1ef97d43289c6ee9" dmcf-pid="xLADntnQCg" dmcf-ptype="general">채명수 노타 대표는 “AI 모델이 수천억, 수조개의 매개변수 규모로 커지면서 산업의 경쟁축이 모델 자체의 성능을 넘어 운영 효율로 이동하고 있다”며 “이번 성과는 그동안 축적한 최적화 연구를 기반으로 초거대 언어모델과 데이터센터 AI 인프라의 효율을 높일 기술적 기반을 확보했다는 의미가 있다”고 말했다. </p> <p contents-hash="5dca7a3c3215ab8afa70ed62c3c3ed7cbd24105c05b7f9ad2c3b2dcc6f3a2aec" dmcf-pid="y1Uq5o5Tlo" dmcf-ptype="general">이어 “최신 AI 모델의 구조 변화에 선제적으로 대응할 수 있도록 연구개발 투자와 지원을 이어갈 것”이라며 “AI 인프라 도입의 효율을 높이는 핵심 최적화 기술의 적용 범위도 지속해서 확대하겠다”고 덧붙였다. </p> <p contents-hash="301011b9683961c1aaa23b06cb7b963b42e3979895b92edd103ac4a2d76a83e0" dmcf-pid="WtuB1g1ySL" dmcf-ptype="general">저작권자 © Tech42 - Tech Journalism by AI 테크42 무단전재 및 재배포 금지</p> </section> </div>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기