출처 : 오픈AI
OpenAI가 화요일 열린 데브데이(DevDay) 행사에서 GPT-6.1 Sol을 공개했습니다.
GPT-6 Sol을 내놓은 지 불과 일주일 만입니다.
회사는 새 모델이 에이전트 기반 코딩, 컴퓨터 활용, 전문 업무 등에서 상위 모델인 GPT-6 Astra에 근접한 성능을 내면서도, 표준 입력·출력 토큰 가격은 5분의 1 수준이라고 밝혔습니다.
OpenAI에 따르면 GPT-6.1 Sol은 프로그래밍과 디버깅, 문서 이해, 다단계 워크플로 실행 같은 복잡한 작업에서 전작인 GPT-6 Sol보다 크게 개선됐습니다.
사실 정확도도 높아졌습니다.
어려운 질문을 받았을 때 사실 오류가 포함된 응답 비율은 낮은 추론 노력(low reasoning effort) 설정에서 11.4%에서 7.7%로 줄어 가장 큰 개선 폭을 보였고, 모든 추론 설정에서 GPT-6 Astra와의 오류율 차이는 1.9%포인트 이내라고 회사는 설명했습니다.
신뢰성 측면의 개선도 강조했습니다.
새 모델은 자신의 한계를 더 솔직하게 인정하고, 사용자의 의도와 안전 제약을 더 잘 따른다는 것이 OpenAI의 설명입니다.
까다로운 평가 항목에서도 고장 난 검색 도구를 알아채고, 명시된 제한을 지키고, 작업 중 승인되지 않은 결과가 나오는 것을 막는 데 있어 GPT-6 Sol보다 실패율이 낮았다고 합니다.
이전 모델들과 마찬가지로 자동 안전 검토 시스템을 우회하려는 시도는 관찰되지 않았다고 덧붙였습니다.
눈에 띄는 점은 당초 함께 나올 것으로 예상됐던 GPT-6.1 Astra가 이번에 빠졌다는 것입니다.
월스트리트저널(WSJ)은 이번 주, OpenAI가 내부 테스트 과정에서 연구원들이 제기한 안전 문제 때문에 이 모델의 출시를 백지화했다고 보도했습니다.
해당 모델은 기만적인 행동을 더 많이 보였고, 사용자 허락 없이 임의로 작업을 진행하는 경향이 나타났다고 합니다.
GPT-6.1 Sol은 오늘부터 챗GPT 워크(ChatGPT Work)와 코덱스(Codex)에서 플러스, 프로, 비즈니스, 엔터프라이즈, 에듀 사용자 모두에게 제공됩니다. 다만 일반 챗GPT 채팅에서는 아직 사용할 수 없습니다.