TOPIC
AI 연구
AI 연구 관련 콘텐츠 166건입니다. 주장과 팩트를 분리하고 검증 단계를 표기했습니다.
AI 에이전트 성능 평가의 한계 돌파, 자동화 벤치마크 생성 기술 TASTE 공개
미검IBM 연구진이 기존 AI 에이전트 평가 체계의 포화 문제를 해결하기 위해 자동화된 벤치마크 생성 프레임워크 TASTE를 발표했습니다. 이 기술은 도구 사용 조합을 대폭 확장하고 난이도를 진화시켜, 기존 모델들의 성능 거품을 효과적으로 식별합니다.
인공지능의 인간 인지 및 사회적 영향력 측정 체계 도입
검증인공지능 기술이 인간의 인지 능력과 대인 관계에 미치는 영향력을 체계적으로 측정해야 한다는 목소리가 높습니다. 현재의 기술 중심적 성능 평가를 넘어 인간의 복지를 고려한 새로운 평가 지표 마련이 시급합니다.
매사추세츠 대학교 등 연구진, 데이터 직접 탐색하는 AI 에이전트 'GrepSeek' 개발
미검매사추세츠 대학교 애머스트 캠퍼스 등 공동 연구진이 거대언어모델이 외부 검색 엔진 없이 직접 말뭉치를 탐색하는 기술을 선보였습니다. 기존 방식보다 검색 속도를 최대 7.6배 높였으며, 7개 오픈 도메인 질의응답 벤치마크에서 최고 성능을 기록했습니다.
엔비디아 네모트론 3 울트라의 미국 오픈 모델 성능 1위 달성
미검엔비디아의 인공지능 모델 네모트론 3 울트라가 미국 오픈 모델 중 최고 성능을 기록했습니다. 빠른 처리 속도를 바탕으로 인공지능 인프라 시장에서의 영향력을 확대하고 있습니다. 다만 중국 모델과의 성능 격차는 여전히 존재합니다.
미니맥스, 100만 토큰 지원 M3 모델 공개
미검미니맥스가 오픈 웨이트 모델 최초로 100만 토큰의 문맥 창과 네이티브 멀티모달 기능을 갖춘 M3 모델을 발표했습니다. 자체 개발한 어텐션 기술을 통해 연산 비용을 획기적으로 낮추고 코딩 성능을 대폭 강화했습니다.
AI 산업의 중심 이동: 현장 배치 엔지니어와 에이전트 인프라 구축
미검인공지능 산업의 무게중심이 모델 성능 경쟁에서 현장 배치 엔지니어링과 에이전트 인프라 구축으로 옮겨가고 있습니다. 기업들은 실제 업무 환경에서 작동하는 관리형 실행 환경을 수직적으로 통합하는 데 집중합니다.
아마존 세이지메이커 AI의 거대언어모델 추론 관측성 확보 전략
검증아마존 세이지메이커 AI는 인프라 지표와 모델 품질 지표를 통합 관리하여 거대언어모델 운영의 효율성을 높입니다. 사용자는 클라우드워치와 그라파나를 활용해 실시간으로 자원 사용량과 모델 성능을 모니터링할 수 있습니다.
AI 에이전트의 핵심 기술인 코드와 하니스 구조
검증인공지능 에이전트가 추론하고 행동하는 본질은 코드와 이를 뒷받침하는 하니스 환경에 있습니다. 연구진은 모델 성능을 넘어 소프트웨어 인프라가 에이전트의 경쟁력을 결정한다고 분석합니다.
PyTorch 프로파일러 활용을 통한 모델 성능 최적화 방법
검증인공지능 모델의 성능을 높이기 위해 연산 병목 구간을 파악하는 프로파일링 과정이 필수적입니다. 허깅페이스가 공개한 프로파일러 학습 시리즈를 통해 연산 효율을 개선하는 구체적인 방법을 정리했습니다.
앤스로픽, 클로드 오퍼스 4.8 출시 및 성능 향상
검증앤스로픽이 차세대 인공지능 모델 클로드 오퍼스 4.8을 공개했습니다. 주요 벤치마크에서 경쟁 모델을 앞서는 성능을 보이며, 작업 효율성과 정직성을 대폭 개선했습니다.