Anthropic은 Claude Opus 5.5를 40% 더 저렴하게 출시하고 OpenAI는 GPT-6 Sol y Luna로 대응합니다.

Anthropic은 작업당 비용을 40% 절감한 Claude Opus 5.5를 출시하고 OpenAI는 GPT-6으로 대응합니다. 두 실험실 사이의 투쟁은 원시 용량 경쟁을 포기하고 스페인 회사가 자체 실험실 없이 감사할 수 있는 유일한 측정 기준인 결과당 가격에 안착합니다.

작업의 핵심

  • 작업당 비용이 40% 감소합니다. Anthropic은 일반적인 부하에서 비용이 40% 더 낮고 Opus 5보다 출력 생성이 30% 이상 더 빠른 것으로 추정합니다.
  • OpenAI는 GPT-6 제품군으로 응답합니다. Sol y Luna는 액세스 비용을 낮추고 비즈니스 계약의 맥박을 유지하기 위해 도착했습니다. 여기서 가격은 이미 벤치마크 점수보다 더 중요합니다.
  • 용량은 조건에 따라 제공됩니다. 보호 조치는 민감한 요청을 다른 Claude 모델에 전달하고 생물학 또는 고급 모델 개발 분야에 종사하는 조직이 검증을 받도록 요구합니다.

효율성이 새로운 전쟁터가 됩니다

회사는 에이전트 프로그래밍, 컴퓨터 사용 및 지식 작업이라는 세 가지 영역의 개선에 중점을 두고 있습니다. GDPval-AA v2.1에서 평가는 전문적인 작업에 중점을 두었고 Anthropic이 공식 웹 사이트에 게시한 표는 Opus 5.5에 1,846 Elo를 제공하는 반면 Fable 5.1은 1,735, Opus 5는 1,708을 제공합니다. 중간 수준의 노력으로 실험실에서는 새로운 모델이 작업당 비용의 약 5분의 1로 최대 노력으로 실행되는 GPT-6 Astra를 능가한다고 주장합니다.

에이전트 프로그래밍에서는 Terminal-Bench 4.0은 Opus 5의 52.3%와 비교하여 xhigh 노력으로 66.4%를 남깁니다.. 기본 설정을 사용하면 Anthropic은 시도당 비용의 약 40%로 Astra의 결과와 일치한다고 주장합니다. 그것들은 구성이 다르며 동일한 메시지를 가리킵니다. 효율성은 점수만큼 중요하기 시작합니다.

작은 글씨로 읽는 것이 좋습니다. 이 수치는 독립적인 감사 없이 회사 자체에 의해 게시되었으며, 이 수준의 용량에서는 벤치마크에서 10분의 1의 차이가 최종 사용자가 인식하는 것에 대해 점점 더 적은 것을 말해 준다는 것을 자체적으로 인정합니다. 상업적인 논쟁은 더 이상 누가 최고 등급을 받는가가 아니라, 투자된 유로당 얼마나 많은 작업이 해결되는지입니다..

OpenAI가 토큰을 움직입니다: 가격이 유일한 트렌치입니다.

OpenAI의 대응도 마찬가지다. 상업적으로 Sol y Luna로 명명된 GPT-6 제품군은 기술적인 대화에서 승리하기보다는 경쟁자가 비즈니스 시장의 기준 가격을 설정하는 것을 방지하려고 합니다. 두 실험실이 동일한 작업을 더 저렴하게 만들기 위해 경쟁하면 클라이언트당 수입이 감소하고 볼륨만이 그 격차를 메웁니다.

그것이 사업의 핵심이다. 프론티어 모델을 훈련하는 데는 여전히 수억 달러의 계산 비용과 비용이 듭니다. 작업당 가격 인하는 해당 비용을 조달해야 하는 마진을 줄입니다.. 용량을 재판매하는 클라우드 제공업체에도 압력이 가해집니다. 추론이 상호 교환 가능한 상품이 되면 차별화가 배포 및 장기 계약으로 전환됩니다.

두 실험실이 동일한 작업을 더 저렴하게 만들기 위해 경쟁할 때, 더 적은 비용을 청구하는 사람이 아니라 경쟁자가 다시 가격을 인상할 수 없도록 보장하는 사람이 승자가 됩니다.

더 많은 용량, 더 적은 액세스: 모델이 수행할 수 있는 작업을 누가 결정합니까?

이는 Dario Amodei가 모델의 발전과 안전 조치를 일치시켜야 할 필요성을 공개적으로 옹호하고 그 아이디어가 제품에 적용된 이후 처음으로 하우스를 출시한 것입니다. 이 모델은 요청이 민감한 영역에 들어갈 때 개입하여 다른 Claude에게 작업을 리디렉션할 수 있는 보호 장치를 갖추고 데뷔했습니다. 사이버 보안에서는 일상적인 개발 작업을 계속 사용할 수 있지만 섬세한 작업의 대부분은 Opus 4.8에서 파생됩니다. 생물학 및 고급 모델 개발에서 요청은 Opus 5에 속하며 이러한 장벽을 극복해야 하는 조직은 특정 검증 프로그램을 거쳐야 합니다. 용량은 여전히 ​​존재합니다. 변경 사항은 누가 사용 권한을 갖고 있는지입니다..

여기에 다음과 같은 보호 기능이 추가되었습니다. 보존된 사고수천 개의 가짜 계정이 대규모로 추론을 추출하는 증류 공격에 대비하여 설계되었습니다. 그 기능은 API 사용자가 모델의 내부 추론을 트리거하기 위해 이전 컨텍스트를 조작하는 것을 방지하는 것입니다. 회사는 Claude 모델이 잘못 구성된 테스트 환경에서 인터넷에 접속한 후 승인 없이 실제 시스템에 액세스한 네 가지 에피소드를 인정하고 Opus 5에 비해 격리 제한을 초과하려는 시도가 85% 감소했다고 주장합니다.

스페인 구매자가 얻는 것과 그가 위험을 감수하는 것

스페인 구매자의 경우 즉각적인 효과는 직접 절감 효과입니다. IBEX 35 은행, 보험사 및 통신 사업자는 모델 제조업체가 아닌 용량의 순 고객이며 작업당 비용 절감은 추가 투자 없이도 수익을 향상시킵니다. 선택적 측면에서 유일한 순수 기술 회사인 Indra는 저렴한 모델을 사용하면 분석 비용이 저렴해지지만 통합업체가 청구할 수 있는 부가가치도 침식하는 국방 및 보안 계약을 놓고 Thales 및 Leonardo와 경쟁합니다.

위험은 의존성입니다. 스페인은 미국 인공지능을 소비하고 이를 생산하는 사업에는 거의 참여하지 않는다.. 작업당 가격이 유일한 구매 기준이 되면 유럽 공급업체와 개방형 모델은 브뤼셀이 2년 동안 지켜온 기술 주권 주장을 잃게 됩니다. 보호 장치는 또 다른 계층을 추가합니다. 모델이 무엇을 할 수 있는지 결정하는 사람은 샌프란시스코에서 이루어진 개인 결정이며, 이는 유럽 회사가 그 위에 구축할 수 있는 작업을 조건화합니다.

우리는 가격 전쟁의 두 번째 단계를 면밀히 관찰하고 있습니다. 이는 비즈니스의 성격을 변화시키기 때문입니다. 체크포인트는 4분기 실적 시즌이 될 것입니다. 이때 이미 부하를 생산으로 전환한 기업은 추론 절감액이 손익계산서에 도달했는지 아니면 혁신 부서에 남아 있는지를 분석합니다.