MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 9월 8일 화요일

AI 시대, 당신을 더욱 스마트하게

AI미검

오픈에이아이의 ARC-AGI-3 벤치마크 성능 측정 방식 논란

오픈에이아이가 자사 모델 GPT-5.6 Sol의 성능을 자체 환경에서 측정해 발표했습니다. 하지만 공식 환경에서의 점수와 큰 차이를 보여 성능 평가 기준을 두고 논란이 일고 있습니다.

2026년 7월 30일

팩트오픈에이아이는 자사 인공지능 모델인 GPT-5.6 Sol이 ARC-AGI-3 벤치마크에서 38.3퍼센트의 점수를 기록했다고 발표했습니다. 이는 기존 최고 기록인 앤스로픽 클로드 오퍼스 5의 30.2퍼센트를 상회하는 수치입니다.

팩트해당 테스트 결과는 오픈에이아이가 자체 개발한 리스폰스 API 환경에서 측정되었습니다. 이 환경은 추론 과정을 유지하는 리테인드 리즈닝과 문맥을 요약하는 컴팩션 기능을 포함합니다.

교차검증공식 ARC-AGI-3 테스트 환경에서 GPT-5.6 Sol의 점수는 7.8퍼센트에 그쳤습니다. 이는 모델의 추론 과정이 단계마다 삭제되는 공식 환경의 제약 때문입니다.

주장오픈에이아이는 벤치마크가 모델의 성능뿐만 아니라 기술적 환경까지 포함한다고 주장합니다. 따라서 자체 API 환경을 사용하는 방식이 모델의 잠재력을 보여주기에 적합하다는 입장입니다.

교차검증ARC 프라이즈 측은 공식 점수는 공급업체별 설정을 배제한 표준화된 방식을 따른다고 반박했습니다. 이는 모델 자체의 순수한 성능을 공정하게 비교하기 위한 조치입니다.

팩트ARC 프라이즈는 오픈에이아이의 결과 발표에 대해 공식 대응을 내놓았습니다. 이들은 특정 업체에 최적화된 설정은 공정한 비교가 될 수 없음을 강조했습니다.

교차검증이번 논란의 핵심은 ARC 프라이즈가 사용한 구형 API 방식이 클로드 API가 제공하던 기능을 결여했는지 여부입니다. 기존 비교 방식이 오픈에이아이에게 불리했을 가능성이 제기됩니다.

팩트ARC-AGI-3는 인공지능 모델의 논리적 추론 능력을 측정하기 위해 설계된 벤치마크입니다. 이 지표는 현재 업계에서 모델의 지능 수준을 평가하는 중요한 척도로 활용됩니다.

주장인공지능 모델의 성능 평가 방식이 고도화됨에 따라 벤치마크 환경의 표준화 문제가 중요해지고 있습니다. 높은 점수보다 어떤 환경에서 측정되었는지가 실질적인 성능을 판단하는 기준이 됩니다.

주장기술적 환경의 차이가 결과에 큰 영향을 미치는 만큼, 향후 벤치마크 평가 체계의 투명성 확보가 필요합니다. 평가 기관과 기업 간의 합의된 기준 마련이 시급한 상황입니다.

주장기업이 자체 환경에서 측정한 수치를 공식 성과로 내세우는 행위는 데이터의 신뢰성을 저해할 수 있습니다. 객관적인 제3자 검증 절차를 거친 데이터만이 시장의 신뢰를 얻을 수 있습니다.

출처https://the-decoder.com/openai-claims-gpt-5-6-sol-beats-opus-5-on-arc-agi-3-but-only-with-its-own-custom-test-harness/ 및 오픈에이아이 공식 발표 자료를 교차 검증했습니다.

관련 콘텐츠

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

OpenAIv2.53.0

v2.53.0

GPT-5.5 모델 지원 및 Responses 타입에 tool 이름/네임스페이스가 추가되었습니다. CI 관련 버그 수정으로 NumPy 소스 빌드 및 중복 HTTPX 커버리지가 방지되었습니다.

35일 전

OpenAIv2.52.1

v2.52.1

이번 릴리즈에서는 CI(지속적 통합) 관련 변경 사항이 포함되었습니다. 구체적으로 setup-uv v5를 해당 커밋에 고정하는 작업이 진행되었습니다.

35일 전

TensorRTv1.3.0rc23

v1.3.0rc23 릴리즈

이번 릴리즈에서는 DeepSeek V4 혼합 정밀도 NVFP4 체크포인트 로딩, Gemma4 K=V 레이어 W4A8 체크포인트 로딩 지원 등 모델 지원이 강화되었습니다. 또한, VisualGen 모델에 대한 비대칭 TP 선형 구현, 멀티 프로세스 HTTP 프론트엔드 지원 등 API 개선이 이루어졌습니다. GPT-OSS 및 GLM-5의 Python KV-캐시 트랜시버 기본값 설정, MiniMax-M3 MSA 희소 어텐션 백엔드 추가 등 다양한 기능이 추가되었으며, 여러 버그 수정 및 성능 최적화가 포함되었습니다.

38일 전

OpenAIv2.52.0

v2.52.0

이번 릴리즈에서는 API에 콘텐츠 출처 확인 기능이 추가되었습니다. 또한, 클라이언트에서 Retry-After 지연 시간을 최대 2분까지 지원하도록 수정되었으며, API 키 mTLS HTTP 클라이언트 레시피 관련 문서가 업데이트되었습니다.

38일 전

OpenAIv2.51.0

v2.51.0

이번 릴리즈에서는 API에 fast tier 기능이 추가되었습니다. 또한, 해당 fast tier 기능이 헬퍼 메서드에도 적용되었습니다.

39일 전

PAPERS