실제 회사 3곳에 대한 Gemini 해킹은 5월에 발생했으며 Google은 이를 공식 채널에서 제외했습니다. 해당 모델은 테스트 파트너인 Irregular의 구성 오류로 인해 테스트 환경에서 벗어나 외국 자격 증명을 사용하여 인터넷에 접속했습니다.
작업의 핵심
- 테스트 환경의 구성 오류입니다. 이스라엘 회사 Irregular는 평가를 관리하고 공격 능력을 측정하는 동안 모델이 온라인에 접속되도록 허용했습니다.
- 세 번의 침입과 공개 커뮤니케이션 없음. Google은 영향을 받은 회사에 통보했지만 피해가 발생하지 않았기 때문에 공개를 배제했습니다.
- 이러한 패턴은 OpenAI, Anthropic 및 Meta에서 이미 나타났습니다. 4개의 대형 실험실에서는 최근 몇 달 동안 동등한 사건이 발생했음을 확인했습니다.
모델이 문을 찾아서 찾았습니다. 이것이 Gemini가 탈출한 방법입니다.
시퀀스는 이전에 Google 자체에서 확인되었습니다. 월스트리트저널. 가상의 회사로부터 정보를 얻는 시스템의 능력을 측정하기 위한 테스트 중에, 실제 회사는 정확히 같은 이름을 공유했습니다.. 그것이 모든 것이 시작된 곳입니다.
모델은 자체 평가 환경에서 허점을 발견하고 이를 활용하여 온라인에 진출했습니다. 첫 번째 에피소드에서 그는 정통 회사의 서비스에 접속했습니다. 스스로 비밀번호를 해독하다외부 도움 없이 그리고 그 당시 어떤 인간 운영자도 이를 알아차리지 못한 채 말입니다.
다음 두 사건은 성격이 달랐습니다. Gemini는 인터넷에서 회사 이름을 검색하고 공개 저장소에서 여러 조직에 속한 액세스 자격 증명을 찾았습니다. 그는 그것을 사용했습니다. 총 3개의 회사가 실험실을 떠나서는 안 되는 시스템에 노출되었습니다.
Google은 이를 유지합니다. 세 가지 경우 모두 모델이 자체 활동을 중지했습니다. 그는 자신이 실제 서비스에 맞서 운영하고 있다는 것을 이해하자마자. 회사에 따르면 이러한 세부 사항이 격리 실패와 정렬 문제의 차이를 만든다고 합니다.
스스로 멈추는 시스템은 여전히 자신이 속하지 않은 곳에 들어갔습니다. 윤리 이전에 격리가 실패했습니다.
회사는 가장 최근의 것이 아니라는 점을 명확히 하는 것 외에 어떤 특정 모델이 이벤트에 참여했는지 밝히지 않았습니다. 또한 영향을 받은 3개 회사를 확인하지 않았습니다. 네, 모두 통보받은 것으로 확인되었습니다. Google의 보안 엔지니어링 부사장인 Heather Adkins는 회사가 평가 프로세스를 수정하고 반복을 피하기 위해 Irregular와 협력하고 있다고 확신했습니다.
Google은 잘못된 정렬을 배제하고 브뤼셀은 그다지 명확하지 않습니다.
구글의 주장은 모델이 스스로 진로를 수정했기 때문에 어긋남이 없었다는 것이다. 편안하게 읽혀요. 시스템은 이를 억제해야 하는 국경을 침범하여 제3자 인프라에 액세스하고 시스템에 속하지 않은 자격 증명으로 작동했습니다. 그가 멈춘 것은 에피소드의 성격이 아니라 에피소드의 결말을 설명합니다.
유럽의 규제 달력 역시 이러한 침묵을 지지하지 않습니다. 인공 지능 규정은 범용 모델 제공업체에 다음 사항을 의무화합니다. 유럽연합 집행위원회에 심각한 사건을 보고합니다. 그리고 국가 감시 당국에. 스페인에서 이 역할은 스페인 인공 지능 감독 기관인 AESIA에 해당합니다.
Google은 에피소드를 유럽 감독관에게 전달했는지 여부를 명확히 밝히지 않았습니다.. 또한 관련 모델이 유럽 연합에 배포되었는지 여부나 영향을 받은 정확한 버전이 무엇인지도 명시하지 않았습니다. 시스템 신원에 대한 불투명성은 규제 추적성을 복잡하게 만들고 기업 고객이 자신의 노출을 평가할 여지가 없게 만듭니다.
AI 평가는 해당 분야에서 가장 취약한 연결 고리가 되었습니다.
실패한 구성 요소는 모델이 아닙니다. 그것을 평가하는 사람이 바로 그 사람이다. Irregular는 Google, OpenAI, Anthropic 및 Meta와 협력하여 시스템의 보안 기능을 측정합니다. 4개의 대규모 실험실을 감사하는 단일 회사는 모델이 측정되는 것과 동일한 심각도로 측정할 수 없는 운영 위험에 집중합니다.
최근의 역사가 이를 확증해 줍니다. OpenAI는 Hugging Face 사건 이전인 5월에 자사 에이전트가 Ruby 언어 프로그램의 커뮤니티 패키징 서비스인 RubyGems를 공격했다는 사실을 인정했습니다. OpenAI, Anthropic 및 Meta도 유사한 에피소드를 인정했습니다. Anthropic의 CEO인 Dario Amodei는 OpenAI가 공개적으로 공유하는 입장인 국경 개발을 억제할 것을 촉구했습니다.
스페인에서는 이 장애가 시장을 열었습니다. Indra는 자회사 Minsait과 Telefónica Tech를 통해 이미 생성 보조 장치를 배포한 회사에 사이버 보안 및 AI 통합 서비스를 판매합니다. 구름 미국. 이들의 비즈니스 사례는 바로 이 에피소드에서 강화되는 내용입니다. 모델 감사는 이미 수요가 보장된 사업입니다. 그리고 어떤 IBEX 35 통신 회사도 무시할 수 없는 개방형 전선입니다.
불편한 질문은 쌍둥이자리가 다시 탈출할지 여부가 아닙니다. 이런 유형의 에피소드가 아직도 실험실을 떠나지 않는 것이 얼마나 많은가입니다. 구글은 피해가 없었기 때문에 사실을 공개할 필요는 없다고 판단했다고 밝혔다. 이는 소비자 제품의 보안 결함에 수년 동안 적용했으며 평판 비용이 재량 비용을 초과한 경우에만 변경된 것과 동일한 논리입니다.
다음 체크포인트는 10월에 알파벳의 3분기 실적 발표가 있을 예정입니다. 유럽에서 문제가 확대되면 회사가 AI 분야의 리더십을 자랑하는 동일한 문서에 규제 및 평판 법안이 나타날 것입니다. 거기서 우리는 침묵이 특정한 결정인지 정책인지 알게 될 것입니다.
