MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 7월 21일 화요일

AI 시대, 당신을 더욱 스마트하게

AI미검

대형 언어 모델의 추론 능력 향상 위한 SEED 학습 프레임워크 공개

대형 언어 모델이 복잡한 작업을 수행할 때 발생하는 보상 희소성 문제를 해결하는 SEED 프레임워크가 발표되었습니다. 연구진은 사후 분석을 통해 기술을 추출하고 이를 정책 모델에 증류하여 학습 효율을 극대화했습니다. 텍스트 및 시각 기반 에이전트 작업에서 성능 향상을 입증했습니다.

2026년 7월 20일

주장대형 언어 모델이 복잡한 환경에서 스스로 학습하고 진화하는 에이전트(Agentic)로 거듭나고 있습니다. 하지만 긴 호흡의 작업을 수행할 때 최종 결과에만 의존하는 강화학습(RL) 방식은 중간 과정에 대한 정보를 충분히 제공하지 못합니다.

팩트이번 연구에는 진양 우(Jinyang Wu)를 포함한 다국적 연구진이 참여했습니다. 연구진 소속 정보는 arxiv 등록 기준입니다. 이들은 SEED(Self-Evolving On-Policy Distillation, 자기 진화형 온-폴리시 증류)라는 새로운 프레임워크를 제안했습니다.

팩트SEED는 완료된 궤적을 사후 분석하여 재사용 가능한 기술(Skill)을 추출합니다. 이 기술은 잠재 공간(Latent Space, 데이터의 핵심 특징을 압축하여 표현하는 다차원 공간) 내에서 의사결정 규칙이나 실패 회피 전략을 정의합니다.

주장기존 강화학습은 에피소드 단위의 결과에만 집중하므로 토큰 단위의 학습에는 한계가 있었습니다. SEED는 정책 모델이 직접 궤적을 분석하고 기술을 생성하게 함으로써 이러한 감독 격차를 해소합니다.

팩트SEED는 샘플링된 행동을 일반 환경과 기술이 보강된 환경에서 각각 재평가합니다. 이를 통해 기술 기반의 확률 변화를 토큰 단위의 밀도 높은 증류 신호로 변환합니다.

주장정책 모델은 궤적을 수집함과 동시에 분석가 역할을 수행합니다. 정책이 개선될수록 기술 분석 능력도 함께 향상되는 자기 진화 구조를 갖추고 있습니다.

교차검증본 논문은 arxiv에 공개된 선공개 논문으로, 정식 학술지나 학회의 동료 평가(Peer Review) 과정을 거치지 않았습니다. 따라서 연구 결과의 학술적 엄밀함은 향후 검증이 필요합니다.

팩트연구진은 텍스트 기반 작업과 시각 기반 에이전트 작업에서 SEED의 성능을 검증했습니다. 실험 결과, 기존 방식 대비 성능 향상과 더불어 샘플 효율성이 크게 개선되었습니다.

주장보이지 않는 새로운 시나리오에서도 SEED는 강건한 일반화 능력을 보였습니다. 이는 특정 환경에 과적합되지 않고 범용적인 문제 해결 능력을 갖췄음을 의미합니다.

교차검증다만, 이번 연구는 다양한 환경에서의 일반화 성능을 강조하지만, 복잡도가 극도로 높은 실세계 환경에서의 재현성과 설명 가능성에 대해서는 추가적인 검증이 필요합니다. 특히 데이터셋 편향이 모델의 기술 추출 과정에 미치는 영향은 여전히 해결해야 할 과제입니다.

팩트SEED는 결과 기반 강화학습과 기술 증류 신호를 결합하여 최적화를 수행합니다. 이 과정에서 보조적인 감독 신호를 현재의 궤적 분포와 일치시킵니다.

출처arxiv의 선공개 논문(https://arxiv.org/abs/2607.14777)을 참고했습니다.

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

NVIDIA/Megatron-LMcore_v0.18.2

NVIDIA Megatron Core 0.18.2

NVIDIA Megatron Core 0.18.2 릴리즈는 Transformer Engine의 크로스 엔트로피 손실 융합을 비활성화하고, fast-hadamard-transform 및 flash_mla를 추가했습니다. 또한, Transformer Engine을 release_v2.16.post 버전으로 업데이트했습니다.

10시간 전

LangChainlangchain-core==1.5.0

langchain-core==1.5.0

langchain-core 1.5.0 버전이 출시되었습니다. 이번 업데이트에서는 표준 채팅 모델 파라미터로 `reasoning_effort`가 추가되었습니다. 또한, soupsieve 및 mistune 라이브러리가 업데이트되었습니다.

17시간 전

mistralai/mistral-commonv1.11.6

v1.11.6: 수정 및 문법 선택기 패치

이번 릴리즈에서는 오디오 청크 유효성 검사 시 ValidationError 대신 ValueError를 발생시키도록 수정되었습니다. 또한, 샘플링 속도가 프레임 속도보다 낮은 AudioConfig를 거부하고, SentencePiece에서 SpecialTokenPolicy.RAISE 시 일반 토큰을 디코딩하도록 변경되었습니다. 토크나이저에서 문법 변형을 자동 선택하고, SpeechRequest OpenAI 변환 시 시드 필드가 올바르게 처리되도록 수정되었습니다.

4일 전

OpenAIv2.46.0

2.46.0 (20260717) Full Changelog: v2.45.0...v2.46.0(https://github.com/openai/openaipython/compare/v2.45.0...v2.46.0)

4일 전

Anthropicv0.117.0

v0.117.0

이번 릴리즈에서는 dreaming 및 MCP Tunnels API 지원이 추가되었습니다. 또한, SecretStr을 사용하여 traceback에서 credential 정보가 노출되지 않도록 수정되었으며, 문서 필드 설명 및 예제 업데이트가 포함되었습니다.

5일 전

PAPERS