TOPIC
AI 연구
AI 연구 관련 콘텐츠 166건입니다. 주장과 팩트를 분리하고 검증 단계를 표기했습니다.
네이처 논문 재현하는 AI 코딩 에이전트 성능 평가, 네이처벤치 공개
미검네이처 학술지 논문 90편을 기반으로 AI 코딩 에이전트의 과학적 문제 해결 능력을 검증하는 네이처벤치가 공개되었습니다. 연구진은 현재의 AI 모델이 실제 과학적 발견보다는 기존 방법론의 단순 변환에 머물러 있음을 확인했습니다.
기업용 AI 에이전트 성능 평가 벤치마크 '엔터프라이즈클로벤치' 공개
미검프론티스AI(FrontisAI) 연구진이 실제 기업 업무 세션을 기반으로 한 AI 에이전트 평가 체계인 엔터프라이즈클로벤치를 발표했습니다. 이 벤치마크는 복합적인 비즈니스 환경에서 AI의 실질적인 업무 수행 능력을 측정하는 새로운 기준을 제시합니다.
대규모 도구 생태계 속 LLM 에이전트의 장기 계획 능력 평가, 'PlanBench-XL' 공개
미검일리노이 대학교 어바나-샴페인(UIUC) 연구진이 대규모 도구 생태계에서 거대언어모델(LLM) 에이전트의 장기 계획 능력을 측정하는 벤치마크 'PlanBench-XL'을 발표했습니다. 이번 연구는 복잡한 도구 환경에서 에이전트의 적응형 계획 수립 한계를 진단하고 개선 방향을 제시합니다.
오픈 소스 AI의 기술적 도약, GLM-5.2 공개
미검Z.ai가 강화학습 프레임워크 SLIME을 기반으로 개발한 GLM-5.2를 공개했습니다. 이 모델은 폐쇄형 모델과 대등한 코딩 및 에이전트 성능을 보이며 오픈 소스 생태계의 변화를 예고합니다.
다국어 프로그래밍 평가 벤치마크 'Multi-LCB' 공개
미검기존 파이썬 중심의 코드 생성 평가 체계를 12개 언어로 확장한 새로운 벤치마크 'Multi-LCB'가 등장했습니다. 연구진은 이를 통해 거대언어모델의 언어별 성능 격차와 파이썬 편향성을 명확히 확인했습니다.
로보택시 시장 내 중국 기업의 우위 현황
검증자율주행 산업이 성숙기에 진입하며 데이터 기반의 객관적 평가 지표가 중요해졌습니다. 최근 발표된 지수에 따르면 중국 기업들이 로보택시 시장에서 상위권을 점유하고 있습니다.
지푸 GLM-5.2의 프런티어급 성능 구현과 오픈 모델의 기술적 진화
미검지푸가 공개한 GLM-5.2가 오픈 웨이트 모델 최초로 프런티어급 성능을 기록하며 주목받고 있습니다. 인덱스쉐어 기술을 통한 비용 절감과 함께 에이전트 중심의 통합 개발 환경이 AI 업계의 새로운 기준으로 자리 잡고 있습니다.
인공지능 에이전트 최적화를 위한 오픈 모델 벤치마크 도입
검증허깅페이스가 인공지능 에이전트의 작업 효율성을 측정하는 새로운 벤치마크 도구를 공개했습니다. 에이전트가 소프트웨어를 효과적으로 구동하도록 라이브러리 설계 방식을 개선하는 것이 핵심입니다. 정답 여부뿐만 아니라 토큰 사용량과 오류 발생률 등 경로 효율성을 평가합니다.
모자이크릭스: 기업용 AI 에이전트의 정보 유출 위험과 대응 전략
검증기업용 AI 에이전트가 외부 검색을 수행할 때 발생하는 정보 유출 위험인 모자이크릭스를 분석합니다. 허깅페이스와 서비스나우는 이를 방지하기 위한 새로운 강화학습 기법을 제시했습니다.
게임 이론 내 일반 알고리즘의 우위 입증
검증매사추세츠 공과대학교 연구진이 범용 알고리즘인 정책 경사 방법이 특정 불완전 정보 게임에서 기존 특화 알고리즘보다 우수한 성능을 낸다는 사실을 확인했습니다. 연구진은 이를 검증할 수 있는 표준화된 벤치마크 소프트웨어를 함께 공개했습니다.