Huawei와 DeepSeek의 CUDA 대안이 이제 공개되었으며 Nvidia의 가장 수익성이 높은 사업을 위협하고 있습니다. 두 중국 회사가 함께 개발한 코드는 더 이상 잠겨 있지 않으며 인공 지능 실험실이 미국 회사의 GPU를 거치지 않고 모델을 훈련시키는 것을 목표로 합니다.
이는 사소한 발표는 아니지만 과장되어서도 안 됩니다. CUDA는 다른 어떤 반도체 제조업체도 따라잡을 수 없는 마진으로 인공 지능 가속기 시장을 지배하는 Nvidia의 경쟁 해자의 상당 부분을 뒷받침합니다. Huawei와 DeepSeek가 테이블에 올려놓은 것은 목적지가 아니라 도로의 첫 번째 부분입니다.
작업의 핵심
- DeepSeek은 도구에 대한 코드를 공개합니다. 이 회사는 Ascend 가속기를 프로그래밍하기 위해 Huawei와 함께 개발한 소프트웨어를 공개했습니다. 그 중심에는 엔지니어들이 Ascend 950 칩에 적용하고 있는 고급 언어인 TileLang이 있습니다.
- 128 가속기 슈퍼노드는 차이를 만듭니다. 두 회사는 128개의 Ascend 950 칩을 단일 시스템으로 병합하고 Nvidia가 이점을 구축한 지형인 개별 성능과 통신을 모두 최적화했습니다.
- 시험장으로서의 내몽골. Bloomberg에 따르면 DeepSeek은 중국 자치 지역의 데이터 센터에 최소 160,000개의 Huawei 가속기를 설치할 계획입니다. 이는 국가 하드웨어에 대한 알려진 최대 규모의 베팅입니다.
동맹은 불편한 방향으로 움직이고 있습니다. Huawei는 Ascend 칩으로 중국에서 입지를 다지고 있지만, 큰 문제는 실리콘이 아니라 소프트웨어였습니다. 프로그래머들은 거의 20년 동안 CUDA용으로 글을 작성해 왔으며, 기반을 변경하면 이미 진행 중인 프로젝트의 전체 레이어를 다시 작성해야 합니다.
소프트웨어는 엔비디아의 마지막 벽이었다
화웨이는 CUDA에 대한 자체 대안인 CANN을 보유하고 있지만 그것만으로는 충분하지 않습니다. 개발 생태계는 단지 컴파일러와 소수의 라이브러리만으로 유지되는 것이 아닙니다. 개발 생태계에는 프로덕션에서 나타나는 문제를 해결할 수 있는 디버깅 도구, 문서 및 커뮤니티가 필요합니다. 사실상의 표준이 된 CUDA는 이 기술에 대한 항목에 명시된 바와 같이 그 수준에 도달하는 데 10년 이상이 걸렸습니다.
이것이 바로 DeepSeek이 등장하는 곳입니다. 이 회사는 이 분야에 새로운 것이 아니며 이미 다른 AI 가속기에 대한 최적화를 개발했으며 이제 해당 작업을 Huawei 하드웨어로 이전하고 있습니다. GitHub의 공식 저장소에는 누구나 사용할 수 있는 Ascend 칩과 함께 제공되는 소프트웨어는 물론 가속기 간의 계산 및 통신 라이브러리도 만들었습니다.
펄스는 실리콘에서 결정되지 않습니다. 얼마나 많은 개발자가 자신의 것이 아닌 칩을 작성하는 데 동의하는지에 따라 결정됩니다.
AI 시스템의 성능은 각 칩의 성능뿐만 아니라 서로 통신하는 방식과 엔지니어가 모델을 작동시키는 데 걸리는 시간에 따라 달라지기 때문에 세부 사항이 중요합니다. 128개 가속기의 슈퍼노드는 바로 그 측면을 공격합니다.
Nvidia가 중국 상륙에 걸린 문제
동맹국에 대한 미국의 압력은 계속해서 화웨이가 중국 밖으로 사업을 확장하는 데 주요 제동 장치가 되고 있습니다. 회사는 국경을 넘어 성장하기를 원하지만 미국의 수출 통제로 인해 첨단 제조 기계 및 주요 산업 공급업체에 대한 접근이 제한됩니다.
중국 내에서 이 운동의 수신자는 분명합니다. 정부는 불과 2년 넘게 자국 기업에 칩 생태계를 요청해 왔습니다. DeepSeek은 이러한 요구에 대응할 뿐만 아니라 이를 상업적 전략으로 전환합니다. 코드를 공개한다는 것은 Ascend를 위한 개발자를 한 명씩 설득하지 않고 모집하는 것입니다.
Nvidia의 장점은 결코 하드웨어에만 있는 것이 아닙니다. 아키텍처를 공유 표준으로 전환했기 때문에 공급자를 변경하는 데 비용이 많이 듭니다. Huawei와 DeepSeek가 출시하는 모든 도구는 전환 비용을 약간 줄여주며, 중국 시장은 실험이 경제적일 만큼 충분히 큽니다.
기술 주권: 중국이 유럽에 가르치는 것
중국 탠덤이 칩부터 프로그래밍 언어까지 자체 스택을 구축하는 동안 유럽은 계속해서 하이퍼스케일러 미국인. IBEX 35 회사는 대규모 AI 가속기를 설계하지 않으며 대륙의 대규모 슈퍼컴퓨팅 센터는 대부분 외부 하드웨어에 의존합니다.
대조는 호기심이 아닙니다. 중국은 의사 결정 능력이 기술 의존에 따른 대가라는 점을 이해하고 있으며, 이것이 바로 이미 제조된 솔루션을 구매하는 대신 2년 동안 전체 생태계에 자금을 지원해 온 이유입니다. 브뤼셀에 대한 교훈은 불편합니다. 연설에서 주장된 전략적 자율성은 기술 박람회에 나타나지 않는 눈에 잘 띄지 않는 계층에 대한 지속적인 투자를 요구한다는 것입니다.
중국 생태계가 필요한 성숙도에 도달했는지 여부는 아직 밝혀지지 않았습니다. DeepSeek의 모델은 Ascend에서 실행되지만 Nvidia가 15년 동안 축적한 우위에 비해 도구 카탈로그는 여전히 제한적입니다. TileLang과 나머지 부분이 설득력이 없으면 개발자는 큰 트라우마 없이 알려진 것으로 돌아갈 것입니다. 따라야 할 이정표는 발표가 아니라 실제로 CUDA를 포기한 프로젝트의 수입니다.
