TOPIC
AI 연구
AI 연구 관련 콘텐츠 166건입니다. 주장과 팩트를 분리하고 검증 단계를 표기했습니다.
오픈 소스 인공지능 모델의 성능 평가 한계와 기술 동향
미검오픈 소스 인공지능 모델이 폐쇄형 모델과의 성능 격차를 줄이며 빠르게 발전하고 있습니다. 다만 현재의 벤치마크 방식은 모델의 실제 능력을 충분히 반영하지 못한다는 지적이 제기됩니다.
AI 영상 생성 모델의 물리적 추론 능력 한계와 벤치마크 결과
미검최신 인공지능(AI) 영상 생성 모델들이 시각적 품질과 달리 물리적 법칙과 논리적 인과관계를 이해하는 능력은 부족한 것으로 나타났습니다. 칭화대학교 연구진은 새로운 평가 체계를 통해 상용 모델과 오픈소스 모델 간의 성능 격차를 확인했습니다.
AI 코딩 에이전트 시장 경쟁과 앤스로픽의 구독 정책 변화
미검2026년 5월 14일 기준, AI 코딩 에이전트 시장에서 모델 성능과 API 정책을 둘러싼 기업 간 경쟁이 심화하고 있습니다. 앤스로픽은 구독 모델을 개편했으며, 기술 기업들은 효율적인 에이전트 인프라 구축에 집중하고 있습니다.
캠벨 브라운의 포럼 AI, 인공지능 정보 정확성 검증 체계 구축
검증메타 뉴스 책임자 출신 캠벨 브라운이 설립한 포럼 AI가 인공지능 정보의 정확성을 평가하는 벤치마크를 개발합니다. 각 분야 전문가를 영입해 인공지능 답변의 신뢰도를 인간 전문가 수준으로 높이는 것이 목표입니다.
엔비디아·이네퍼블 인텔리전스 강화학습 인프라 공동 설계
검증엔비디아와 이네퍼블 인텔리전스가 차세대 강화학습 인프라 구축을 위해 협력합니다. 양사는 인공지능이 스스로 지식을 발견하는 시스템을 개발할 계획입니다.
암 약물 반응 예측 모델의 성능 평가 기준과 DrEval 도입
검증암 약물 반응 예측 모델의 실제 임상 적용을 위해 객관적인 평가 체계가 필요합니다. 오픈 소스 벤치마크 도구인 DrEval은 모델의 편향을 제거하고 생물학적 유의성을 검증합니다. 연구자들은 엄격한 데이터 설정과 통계적 분석을 통해 모델의 과적합 문제를 해결해야 합니다.
EU AI 법 대응을 위한 AWS 세이지메이커 연산량 측정 도구 도입
검증유럽연합 인공지능 법 시행에 따라 거대언어모델 파인튜닝 시 연산량 추적이 의무화됩니다. 아마존웹서비스는 세이지메이커 환경에서 연산량을 실시간으로 측정하고 기록하는 도구를 공개했습니다.
AI 에이전트의 사회적 추론 능력 평가 벤치마크 도입
검증마이크로소프트 리서치가 AI 에이전트의 사회적 추론 능력을 측정하는 벤치마크인 '소셜 리즈닝 벤치'를 공개했습니다. 이 도구는 달력 조정과 시장 협상 시나리오를 통해 AI가 사용자의 이익을 최우선으로 대변하는지 평가합니다.
"AI에 욕하면 똑똑해진다?"...반박 논문 등장
미검인공지능에게 무례하게 명령하면 성능이 향상된다는 주장을 뒤집는 연구가 발표됐습니다. 다양한 언어 모델을 교차 검증한 결과, 정중하거나 중립적인 어조를 사용할 때 인공지능이 더 높은 정확도를 보였으며, 특히 인문학처럼 복잡한 추론이 필요한 분야에서는 무례한 어조가 성능을 하락시킨 것으로 나타났습니다.
AWS SageMaker 기반 GRPO 강화학습 활용 전략
검증대규모 언어 모델 학습 시 발생하는 보상 해킹 문제를 해결하기 위해 검증 가능한 보상 기반 강화학습과 GRPO 알고리즘을 결합합니다. AWS SageMaker AI 환경에서 수학 및 코드 생성 작업의 효율을 높이는 실무적인 구현 방안을 제시합니다.