TOPIC
AI 연구
AI 연구 관련 콘텐츠 166건입니다. 주장과 팩트를 분리하고 검증 단계를 표기했습니다.
거대언어모델 온폴리시 증류의 기하학적 구조와 학습 역학 규명
미검연구진은 온폴리시 증류(OPD)가 거대언어모델의 추론 능력을 향상하는 과정에서 나타나는 파라미터 공간의 변화를 분석했습니다. 연구 결과 OPD는 지도 미세 조정(SFT)이나 강화 학습(RLVR)과는 차별화된 고유의 학습 기하학적 구조를 형성함을 확인했습니다.
소프트웨어 개발 에이전트의 코드 탐색 능력 평가 벤치마크 'SWE-Explore' 공개
미검최근 연구진은 코딩 에이전트의 저장소 탐색 능력을 정밀하게 측정하는 새로운 벤치마크인 'SWE-Explore'를 발표했습니다. 이 도구는 기존의 이분법적 평가 방식을 넘어 에이전트의 코드 위치 파악과 맥락 이해 능력을 다각도로 분석합니다.
거대언어모델 중재 능력 평가 프레임워크 'SoCRATES' 공개
미검국내 연구진이 거대언어모델(LLM)의 갈등 중재 능력을 정밀하게 평가하는 새로운 벤치마크 'SoCRATES'를 개발했습니다. 실제 갈등 상황을 반영한 8개 도메인에서 모델의 사회적 적응력을 측정하며 기존 평가 방식의 한계를 극복했습니다.
오픈소스 에이전트 학습을 위한 OpenEnv 표준화 추진
검증오픈소스 커뮤니티가 에이전트 강화학습 환경을 통합하는 OpenEnv 표준화를 시작합니다. 주요 AI 기업과 연구소들이 참여하여 파편화된 학습 환경을 개선하고 범용 인터페이스를 구축합니다.
연합 학습 기반 간 병변 탐지 기술 페드오지 개발
검증연구진이 다기관 데이터를 활용해 간 병변을 정확히 탐지하는 연합 학습 모델 페드오지를 개발했습니다. 이 기술은 데이터 이질성을 극복하고 의료 정보 보호와 모델 성능 향상을 동시에 달성합니다.
소설 속 인물처럼 행동하는 AI, ArcANE 벤치마크로 캐릭터 일관성 검증
미검연구진은 소설 속 인물의 심리적 변화를 추적하여 역할 수행 언어 모델의 연기 능력을 평가하는 ArcANE 벤치마크를 공개했습니다. 이 평가 도구는 기존 모델들이 소설 외부 상황에서도 캐릭터의 성격 변화를 유지하도록 유도합니다.
강화학습 모델 성능 향상을 위한 학습 하니스 품질 개선 전략
미검강화학습 모델의 성능 저하는 모델 자체의 결함보다 학습 환경인 학습 하니스의 불안정성에서 기인합니다. 모델의 실전 적용을 위해서는 소프트웨어 공학적 관점에서 환경 오류를 제어하고 데이터 품질을 확보하는 노력이 필요합니다.
벤처캐피털 벤치마크의 20억 달러 규모 펀드 조성과 전략 변화
검증벤처캐피털 벤치마크가 20년 만에 기존 펀드 규모 제한 전략을 폐기하고 20억 달러 규모의 자금을 조성했습니다. 이번 변화는 인공지능 분야의 대규모 투자 수요에 대응하기 위한 결정입니다.
이데오그램 4.0 오픈 웨이트 모델 공개와 텍스트 렌더링 성능 강화
검증이데오그램이 텍스트 렌더링과 정밀한 레이아웃 제어 기능을 갖춘 오픈 웨이트 모델 4.0을 공개했습니다. 사용자는 파트너 플랫폼을 통해 모델을 활용할 수 있으며 상업적 이용 시 별도의 라이선스가 필요합니다.
한국형 웹 브라우징 AI 성능 평가 벤치마크 K-BrowseComp 공개
미검한국어 맥락을 반영한 웹 브라우징 에이전트 성능 평가 도구인 K-BrowseComp가 새롭게 발표되었습니다. 최신 거대언어모델(LLM)들이 한국어 기반의 복잡한 웹 탐색 작업에서 낮은 정확도를 보이며 기술적 한계를 드러냈습니다.