{
  "date": "2026-09-30",
  "benchmarks": [
    {
      "id": "deepswe",
      "title": "DeepSWE v1.1",
      "lowerBetter": false,
      "source": "openai-launch",
      "points": [
        {
          "model": "GPT-6 Astra",
          "effort": "low",
          "score": 67.0,
          "cost": 1.6
        },
        {
          "model": "GPT-6 Astra",
          "effort": "medium",
          "score": 72.8,
          "cost": 3.08
        },
        {
          "model": "GPT-6 Astra",
          "effort": "high",
          "score": 73.2,
          "cost": 3.92
        },
        {
          "model": "GPT-6 Astra",
          "effort": "xhigh",
          "score": 74.1,
          "cost": 4.43
        },
        {
          "model": "GPT-6 Astra",
          "effort": "max",
          "score": 73.2,
          "cost": 7.5
        },
        {
          "model": "GPT-6 Sol",
          "effort": "low",
          "score": 37.2,
          "cost": 0.16
        },
        {
          "model": "GPT-6 Sol",
          "effort": "medium",
          "score": 56.6,
          "cost": 0.38
        },
        {
          "model": "GPT-6 Sol",
          "effort": "high",
          "score": 65.3,
          "cost": 0.64
        },
        {
          "model": "GPT-6 Sol",
          "effort": "xhigh",
          "score": 66.6,
          "cost": 1.0
        },
        {
          "model": "GPT-6 Sol",
          "effort": "max",
          "score": 68.8,
          "cost": 2.74
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "low",
          "score": 64.4,
          "cost": 0.17
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "medium",
          "score": 73.0,
          "cost": 0.42
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "high",
          "score": 75.2,
          "cost": 0.65
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "xhigh",
          "score": 71.9,
          "cost": 0.79
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "max",
          "score": 71.9,
          "cost": 1.57
        }
      ],
      "note": "실제 저장소의 기능 구현·리팩터링 113개 작업. Sol high(75.2)가 medium(73.0)보다 높지만 xhigh·max(71.9)는 낮다. OpenAI 차트에 Opus는 없다."
    },
    {
      "id": "gdp",
      "title": "GDP.pdf",
      "lowerBetter": false,
      "source": "openai-launch",
      "points": [
        {
          "model": "Opus 5.5(폴백 포함)",
          "effort": "low",
          "score": 25.6,
          "cost": 0.76
        },
        {
          "model": "Opus 5.5(폴백 포함)",
          "effort": "medium",
          "score": 25.6,
          "cost": 0.8
        },
        {
          "model": "Opus 5.5(폴백 포함)",
          "effort": "high",
          "score": 28.8,
          "cost": 0.83
        },
        {
          "model": "Opus 5.5(폴백 포함)",
          "effort": "xhigh",
          "score": 26.6,
          "cost": 0.96
        },
        {
          "model": "Opus 5.5(폴백 포함)",
          "effort": "max",
          "score": 26.2,
          "cost": 1.55
        },
        {
          "model": "GPT-6 Astra",
          "effort": "low",
          "score": 30.4,
          "cost": 1.7
        },
        {
          "model": "GPT-6 Astra",
          "effort": "medium",
          "score": 30.4,
          "cost": 1.72
        },
        {
          "model": "GPT-6 Astra",
          "effort": "high",
          "score": 31.0,
          "cost": 1.79
        },
        {
          "model": "GPT-6 Astra",
          "effort": "xhigh",
          "score": 32.2,
          "cost": 1.91
        },
        {
          "model": "GPT-6 Astra",
          "effort": "max",
          "score": 31.0,
          "cost": 2.08
        },
        {
          "model": "GPT-6 Sol",
          "effort": "low",
          "score": 21.8,
          "cost": 0.33
        },
        {
          "model": "GPT-6 Sol",
          "effort": "medium",
          "score": 25.4,
          "cost": 0.34
        },
        {
          "model": "GPT-6 Sol",
          "effort": "high",
          "score": 28.0,
          "cost": 0.35
        },
        {
          "model": "GPT-6 Sol",
          "effort": "xhigh",
          "score": 23.8,
          "cost": 0.37
        },
        {
          "model": "GPT-6 Sol",
          "effort": "max",
          "score": 24.8,
          "cost": 0.43
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "low",
          "score": 27.0,
          "cost": 0.33
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "medium",
          "score": 30.0,
          "cost": 0.34
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "high",
          "score": 32.0,
          "cost": 0.35
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "xhigh",
          "score": 31.8,
          "cost": 0.37
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "max",
          "score": 31.0,
          "cost": 0.42
        }
      ],
      "note": "문서와 프레젠테이션 작업. Sol high(32.0)는 Astra medium(30.4)보다 높다. 경쟁 모델은 폴백을 포함한 평가이며, 별도 모델 단독 점수로 읽으면 안 된다."
    },
    {
      "id": "automation",
      "title": "AutomationBench 1.0.6",
      "lowerBetter": false,
      "source": "openai-launch",
      "points": [
        {
          "model": "Fable 5.1(Opus 5 폴백 사용)",
          "effort": "max",
          "score": 31.4,
          "cost": 2.45
        },
        {
          "model": "Opus 5.5(폴백 사용)",
          "effort": "low",
          "score": 24.2,
          "cost": 0.51
        },
        {
          "model": "Opus 5.5(폴백 사용)",
          "effort": "medium",
          "score": 29.5,
          "cost": 0.65
        },
        {
          "model": "Opus 5.5(폴백 사용)",
          "effort": "high",
          "score": 33.0,
          "cost": 0.71
        },
        {
          "model": "Opus 5.5(폴백 사용)",
          "effort": "xhigh",
          "score": 35.8,
          "cost": 0.89
        },
        {
          "model": "Opus 5.5(폴백 사용)",
          "effort": "max",
          "score": 42.5,
          "cost": 1.44
        },
        {
          "model": "GPT-6 Astra",
          "effort": "low",
          "score": 30.3,
          "cost": 1.08
        },
        {
          "model": "GPT-6 Astra",
          "effort": "medium",
          "score": 34.1,
          "cost": 1.27
        },
        {
          "model": "GPT-6 Astra",
          "effort": "high",
          "score": 37.1,
          "cost": 1.44
        },
        {
          "model": "GPT-6 Astra",
          "effort": "xhigh",
          "score": 39.0,
          "cost": 1.5
        },
        {
          "model": "GPT-6 Astra",
          "effort": "max",
          "score": 41.4,
          "cost": 1.73
        },
        {
          "model": "GPT-6 Sol",
          "effort": "low",
          "score": 21.2,
          "cost": 0.19
        },
        {
          "model": "GPT-6 Sol",
          "effort": "medium",
          "score": 26.9,
          "cost": 0.21
        },
        {
          "model": "GPT-6 Sol",
          "effort": "high",
          "score": 31.2,
          "cost": 0.24
        },
        {
          "model": "GPT-6 Sol",
          "effort": "xhigh",
          "score": 33.2,
          "cost": 0.27
        },
        {
          "model": "GPT-6 Sol",
          "effort": "max",
          "score": 32.0,
          "cost": 0.34
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "low",
          "score": 24.7,
          "cost": 0.16
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "medium",
          "score": 31.7,
          "cost": 0.19
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "high",
          "score": 33.2,
          "cost": 0.23
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "xhigh",
          "score": 35.5,
          "cost": 0.25
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "max",
          "score": 36.1,
          "cost": 0.3
        }
      ],
      "note": "긴 자동화 워크플로우. Sol high(33.2)는 Astra medium(34.1)에 못 미치고, xhigh(35.5)·max(36.1)는 넘어선다. Fable 점에는 일부 폴백 비용이 누락되어 직접 비용 비교에서 제외해야 한다."
    },
    {
      "id": "osworld",
      "title": "OSWorld 2.0 · offline · partial reward",
      "lowerBetter": false,
      "source": "openai-launch",
      "points": [
        {
          "model": "GPT-6 Astra",
          "effort": "low",
          "score": 62.2,
          "cost": 2.72
        },
        {
          "model": "GPT-6 Astra",
          "effort": "medium",
          "score": 69.3,
          "cost": 5.36
        },
        {
          "model": "GPT-6 Astra",
          "effort": "high",
          "score": 70.0,
          "cost": 6.91
        },
        {
          "model": "GPT-6 Astra",
          "effort": "xhigh",
          "score": 71.3,
          "cost": 7.49
        },
        {
          "model": "GPT-6 Astra",
          "effort": "max",
          "score": 73.5,
          "cost": 9.44
        },
        {
          "model": "GPT-6 Sol",
          "effort": "low",
          "score": 43.9,
          "cost": 1.01
        },
        {
          "model": "GPT-6 Sol",
          "effort": "medium",
          "score": 54.0,
          "cost": 1.38
        },
        {
          "model": "GPT-6 Sol",
          "effort": "high",
          "score": 58.3,
          "cost": 1.71
        },
        {
          "model": "GPT-6 Sol",
          "effort": "xhigh",
          "score": 60.5,
          "cost": 2.3
        },
        {
          "model": "GPT-6 Sol",
          "effort": "max",
          "score": 64.4,
          "cost": 3.37
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "low",
          "score": 59.0,
          "cost": 0.42
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "medium",
          "score": 66.8,
          "cost": 0.77
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "high",
          "score": 69.6,
          "cost": 0.96
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "xhigh",
          "score": 69.4,
          "cost": 1.05
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "max",
          "score": 71.4,
          "cost": 1.27
        }
      ],
      "note": "OSWorld 2.0 offline의 부분 보상 지표. Sol high(69.6)는 Astra medium(69.3)와 근접한다. 작업 완료율로 해석하지 않는다."
    },
    {
      "id": "science",
      "title": "Terminal-Bench Science 0.1",
      "lowerBetter": false,
      "source": "openai-launch",
      "points": [
        {
          "model": "Opus 5.5(폴백 사용)",
          "effort": "max",
          "score": 63.3,
          "cost": 23.21
        },
        {
          "model": "GPT-6 Astra",
          "effort": "low",
          "score": 55.4,
          "cost": 11.41
        },
        {
          "model": "GPT-6 Astra",
          "effort": "medium",
          "score": 57.4,
          "cost": 12.34
        },
        {
          "model": "GPT-6 Astra",
          "effort": "high",
          "score": 62.0,
          "cost": 14.95
        },
        {
          "model": "GPT-6 Astra",
          "effort": "xhigh",
          "score": 60.9,
          "cost": 15.76
        },
        {
          "model": "GPT-6 Astra",
          "effort": "max",
          "score": 68.1,
          "cost": 23.8
        },
        {
          "model": "GPT-6 Sol",
          "effort": "low",
          "score": 9.2,
          "cost": 3.0
        },
        {
          "model": "GPT-6 Sol",
          "effort": "medium",
          "score": 14.5,
          "cost": 4.41
        },
        {
          "model": "GPT-6 Sol",
          "effort": "high",
          "score": 14.6,
          "cost": 4.63
        },
        {
          "model": "GPT-6 Sol",
          "effort": "xhigh",
          "score": 25.3,
          "cost": 6.77
        },
        {
          "model": "GPT-6 Sol",
          "effort": "max",
          "score": 27.6,
          "cost": 12.18
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "low",
          "score": 43.7,
          "cost": 1.79
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "medium",
          "score": 47.6,
          "cost": 2.34
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "high",
          "score": 51.1,
          "cost": 2.76
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "xhigh",
          "score": 53.7,
          "cost": 2.89
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "max",
          "score": 57.0,
          "cost": 5.47
        }
      ],
      "note": "Terminal-Bench Science 0.1. Sol max(57.0)는 Astra medium(57.4)에 근접하지만 Astra high(62.0)와 격차가 있다. Opus의 63.3·$23.21은 이 평가의 max·폴백 포함 값이다."
    },
    {
      "id": "factuality",
      "title": "고난도 프롬프트 사실 오류율",
      "lowerBetter": true,
      "source": "openai-launch",
      "points": [
        {
          "model": "GPT-6 Astra",
          "effort": "low",
          "score": 6.3,
          "cost": 0.24
        },
        {
          "model": "GPT-6 Astra",
          "effort": "medium",
          "score": 4.4,
          "cost": 0.31
        },
        {
          "model": "GPT-6 Astra",
          "effort": "high",
          "score": 3.9,
          "cost": 0.48
        },
        {
          "model": "GPT-6 Astra",
          "effort": "xhigh",
          "score": 4.0,
          "cost": 0.6
        },
        {
          "model": "GPT-6 Astra",
          "effort": "max",
          "score": 3.9,
          "cost": 0.79
        },
        {
          "model": "GPT-6 Sol",
          "effort": "low",
          "score": 11.4,
          "cost": 0.05
        },
        {
          "model": "GPT-6 Sol",
          "effort": "medium",
          "score": 6.9,
          "cost": 0.07
        },
        {
          "model": "GPT-6 Sol",
          "effort": "high",
          "score": 5.1,
          "cost": 0.1
        },
        {
          "model": "GPT-6 Sol",
          "effort": "xhigh",
          "score": 4.5,
          "cost": 0.13
        },
        {
          "model": "GPT-6 Sol",
          "effort": "max",
          "score": 4.6,
          "cost": 0.18
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "low",
          "score": 7.7,
          "cost": 0.05
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "medium",
          "score": 6.3,
          "cost": 0.06
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "high",
          "score": 4.5,
          "cost": 0.08
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "xhigh",
          "score": 4.1,
          "cost": 0.1
        },
        {
          "model": "GPT-6.1 Sol",
          "effort": "max",
          "score": 4.6,
          "cost": 0.13
        }
      ],
      "note": "기존 모델이 틀렸던 어려운 프롬프트 집합의 사실 오류율. 낮을수록 좋다. Sol high(4.5)는 Astra medium(4.4)에 근접하고 xhigh(4.1)는 더 낮지만, 일반 대화 오류율을 뜻하지 않는다."
    }
  ],
  "sources": [
    {
      "id": "openai-launch",
      "label": "OpenAI · Introducing GPT-6.1 Sol",
      "url": "https://openai.com/index/introducing-gpt-6-1-sol/",
      "published": "2026-09-29",
      "retrieved": "2026-09-30",
      "type": "공식 공급사 평가",
      "method": "Aside live chart accessibility labels; score 1 decimal and task cost 2 decimals as displayed; competitor fallbacks preserve labels."
    },
    {
      "id": "codex-speed",
      "label": "OpenAI · Codex Speed",
      "url": "https://learn.chatgpt.com/docs/agent-configuration/speed",
      "retrieved": "2026-09-30",
      "type": "공식 제품 문서"
    },
    {
      "id": "aa",
      "label": "Artificial Analysis · Sol 6.1 report",
      "url": "https://artificialanalysis.ai/articles/gpt-6-1-sol-replaces-gpt-6-sol-after-just-7-days-with-near-astra-intelligence",
      "published": "2026-09-29",
      "retrieved": "2026-09-30",
      "type": "독립 평가기관"
    }
  ],
  "independent": {
    "source": "https://artificialanalysis.ai/articles/gpt-6-1-sol-replaces-gpt-6-sol-after-just-7-days-with-near-astra-intelligence",
    "retrieved": "2026-09-30",
    "measurements": [
      {
        "model": "GPT-6.1 Sol",
        "effort": "max",
        "output_tps": 67.8,
        "weighted_tokens_per_task_approx": 38000,
        "intelligence_index": 52,
        "url": "https://artificialanalysis.ai/models/gpt-6-1-sol"
      },
      {
        "model": "GPT-6 Astra",
        "effort": "max",
        "output_tps": 55.7,
        "weighted_tokens_per_task_approx": 27000,
        "intelligence_index": 53,
        "url": "https://artificialanalysis.ai/models/gpt-6-astra"
      },
      {
        "model": "Opus 5.5",
        "effort": "max (with fallbacks)",
        "output_tps": 92.2,
        "weighted_tokens_per_task_approx": 193000,
        "intelligence_index": 58,
        "url": "https://artificialanalysis.ai/models/claude-opus-5-5"
      }
    ],
    "note": "AA 출력 속도는 모델 페이지의 공개값. 토큰 수는 기사 Intelligence Index 4.3.2의 가중 평균 공개 차트 반올림값이며 추론과 답변을 포함한다. 서로 다른 측정 프로토콜이라 두 값을 나누어 실제 완료 시간을 추정하지 않는다. Codex Fast on/off 측정이 아니다."
  }
}
