GPT-6 Sol·Luna 이미지 인식 수정 후 다시 확인할 항목
9월 25일 이미지 인코딩 수정 이후 스크린샷, OCR, 차트를 같은 조건으로 재평가하는 방법과 전후 비교의 한계를 정리합니다.
OpenAI는 2026년 9월 25일 GPT-6 Sol과 GPT-6 Luna의 이미지 이해 성능을 떨어뜨리던 이미지 인코딩 오류를 수정했습니다. 이전에 스크린샷, 문서 이미지, 화면 자동화 작업이 실패했다면 그 결과만으로 모델의 한계를 판단하기 전에 같은 작업을 다시 실행해 볼 수 있습니다. 공식 API 변경 내역은 API와 Codex의 시각 작업, computer use에 이 수정이 적용된다고 설명합니다.
이는 이미지 기반 평가를 다시 살펴볼 근거이지, 모든 코딩 문제가 해결됐다는 증거는 아닙니다. 이 글은 재현 가능한 재평가 절차를 제안합니다. Ofox 벤치마크나 수정 전후 개선율을 보고하는 글은 아닙니다.
발표에서 확인되는 범위
| 항목 | 확인할 수 있는 내용 |
|---|---|
| 명시된 모델 | GPT-6 Sol, GPT-6 Luna |
| 수정 내용 | 이미지 이해를 저하하던 이미지 인코딩 오류 |
| 명시된 환경 | API와 Codex의 시각 작업 및 computer use |
| 공개된 개선율 | 인용한 발표에는 없음 |
| 모든 중개 제공자에 동시 반영됐는지 | 해당 발표만으로 확인할 수 없음 |
평가 기록에는 모델명뿐 아니라 제공자 경로, 실행 시각, 이미지 전처리, 프롬프트, 추론 설정, 도구도 남겨야 합니다. 게이트웨이가 이미지를 변환한다면 남은 오류는 모델보다 변환 과정에서 발생했을 수도 있습니다.
일반적인 작업 선택은 Sol effort 설정 가이드를 참고하되 이번 이미지 처리 오류와 구분해서 판단하세요.
정답을 확인할 수 있는 작은 평가 세트 만들기
실제 작업에서 필요한 이미지를 고르세요. 제공자에게 보낼 권한이 있는 자료를 사용하고 개인정보를 제거합니다. 메신저를 거쳐 반복 저장하지 말고 원본 파일을 보관합니다.
| 평가 | 질문 예시 | 검증 가능한 결과 |
|---|---|---|
| 스크린샷 읽기 | 비활성화된 컨트롤은 무엇인가 | 정확한 라벨과 표시 상태 |
| 문서 OCR | 청구서 식별자는 무엇인가 | 앞자리 0을 포함한 정확한 문자 |
| 차트 읽기 | 마지막 지점에서 가장 높은 계열은 무엇인가 | 계열과 위치, 읽기 어렵다면 불확실성 표시 |
| 화면 위치 파악 | 요청한 버튼은 어디에 있는가 | 같은 스크린샷에서 확인 가능한 위치 |
이는 제안하는 시험 자료이며 완료한 테스트가 아닙니다. 필요한 작업마다 쉬운 이미지와 어려운 이미지를 넣습니다. 흐리거나 잘린 이미지는 ‘판독 불가’도 허용해야 합니다. 값을 지어내는 것은 추출 성공이 아닙니다.
실행 전에 정답과 허용 오차를 정합니다. OCR에서는 공백과 문장부호를 채점할지 결정하고, 차트에서는 정확한 값과 축을 보고 추정한 값을 구분합니다. 화면 조작에서는 인식만 평가할지 이후 도구 동작까지 평가할지도 명시합니다.
조건을 유지하며 다시 실행하기
- 시각, 정확한 모델 ID, 제공자 엔드포인트를 기록합니다. Codex라면 클라이언트 버전, 선택 모델, effort, 관련 도구 설정도 남깁니다.
- 이미지 바이트, 순서, 질문, 요청한 답변 형식을 유지하고 각 입력 파일의 SHA-256을 저장합니다.
- 비교 모델의 설정을 맞춥니다. 한 모델이 지원하지 않는 매개변수는 조용히 빼지 말고 차이를 기록합니다.
- 변동성이 판단에 영향을 준다면 여러 번 실행하고 실패와 거절을 포함한 모든 답을 보관합니다.
- 실행 전에 정한 기준으로 채점합니다. 정확성과 지연 시간, 보고된 사용량은 구분합니다.
수정 전 결과를 실제로 저장해 두지 않았다면 개선율을 주장할 수 없습니다. 새 표에는 ‘수정 후 평가’라고 쓰고 실제 얻은 결과만 비교하세요. 기억에 의존해 과거 오답을 재구성한 것은 기준선이 아닙니다.
CSV 기록에는 다음 열을 사용할 수 있습니다.
run_time_utc,provider,model,client_version,effort,image_sha256,case_id,expected,actual,correct,latency_ms,request_id
제안하는 로그 형식이며 제공자의 응답 스키마는 아닙니다. API 키와 비공개 이미지 URL을 넣지 마세요. 원본 응답은 평가 담당자만 접근할 수 있는 곳에 별도로 저장합니다.
이미지 이해가 여전히 틀린다면
제공자를 바꾸기 전에 API에 실제로 보낸 파일을 열어 크기와 작은 라벨의 가독성을 확인합니다. 로컬 파일명을 텍스트로만 전달한 것이 아니라 이미지 파트가 요청에 포함됐는지도 확인하세요. URL 입력이라면 브라우저 로그인 세션 없이도 제공자가 파일을 가져올 수 있어야 합니다.
다음으로 인식과 동작을 분리합니다. 클릭 도구를 호출하기 전에 대상과 화면 상태를 설명하도록 하세요. 정확히 설명한 뒤 클릭에 실패한 경우와 설명부터 틀린 경우는 원인이 다릅니다. 추출 워크플로에서는 앱이 전체 응답을 파싱하는지, 필요한 필드를 버리지 않는지도 확인합니다.
마지막으로 지원하는 이미지 입력 형식과 실제 요청을 대조합니다. 텍스트 요청의 성공이 이미지 경로의 성공을 증명하지는 않습니다. 직접 OpenAI 요청은 공식 이미지·비전 가이드를, 게이트웨이는 해당 제공자의 문서를 기준으로 확인합니다.
이 작업에 계속 사용할지 판단하기
이번 설정이 자신의 스크린샷이나 문서에 필요한 합격 기준을 충족하는지 판단하세요. 선명한 차트 하나를 읽었다고 앱 전체에서 화면 탐색이 안정적이라고 볼 수는 없습니다.
비용도 비교한다면 이미지 파일 크기로 토큰 수를 추정하지 말고 사용량과 실제 경로를 보관하세요. Sol API 비용 가이드는 입력, 출력, 캐시를 구분하는 이유를 설명합니다. 이 재평가 절차는 새로운 가격이나 할인을 가정하지 않습니다.
자주 묻는 질문
- 이 수정으로 Sol이나 Luna가 Astra보다 비전에 강하다고 볼 수 있나요?
- 아닙니다. 발표는 오류와 수정을 설명할 뿐 Astra와의 통제된 비교가 아닙니다. 비교가 필요하면 같은 이미지와 채점 기준을 사용하고 설정을 기록하세요.
- 텍스트 전용 코딩 벤치마크도 다시 실행해야 하나요?
- 이번 변경은 이미지 이해에 관한 것입니다. 시각 오류가 수정됐다는 이유만으로 텍스트 전용 평가가 무효가 되지는 않습니다. 다른 관련 변경이나 평가 문제가 있을 때 다시 실행하세요.
- 새 결과를 개선율로 표현할 수 있나요?
- 유효한 이전 측정과 정의된 지표가 있을 때만 가능합니다. 저장된 수정 전 기준선이 없다면 수정 후 결과 자체만 보고하세요.


