Roaring back once again?
다시 기세를 떨치는가?
새로운 모델이 중국 AI의 가치에 대한 재평가를 강요하고 있다.
인공지능 분야에서 미국의 대중국 우위가 지난 1년여 만에 가장 좁혀졌을지도 모른다. 2025년 1월, 중국이 '딥시크 R1(DeepSeek R1)'을 출시하며 AI 경쟁 구도를 뒤흔들었을 때, 미국 자본시장에서 1조 달러가 증발했다. 칩 제조사 엔비디아의 주가는 한때 17% 하락했고, 나스닥은 하루 만에 3.1% 급락했다. 미국 투자자들이 불안해했던 것은 중국의 AI가 뛰어났기 때문만이 아니라, 그것이 무료로 제공되었기 때문이었다. 소동은 곧 사그라들었지만, 그 이후로 전 세계 시장 가치는 AI가 혁명적이면서도 수익성까지 갖출 것이라는 기대에 더욱 크게 의존하게 되었다.
이제 중국 연구소들은 모델 시장을 독점하려는 경쟁 속에서 다시 한번 미국 라이벌들을 불안하게 만들고 있다. 6월 13일, 베이징 기반의 연구소 지푸(Zhipu, 또는 Z.ai)는 최신 시스템인 GLM 5.2를 발표하며 "모두를 위한 최첨단 지능에 한 걸음 더 다가섰다"고 공언했다. 이는 지금까지 출시된 중국산 훈련 모델 중 가장 뛰어난 성능을 자랑하며, 앤스로픽의 최신 모델인 '페이블 5(Fable 5)' 가격의 10분의 1 미만으로 작동한다. 다른 중국 모델들과 마찬가지로 GLM 5.2의 작동을 가능하게 하는 가중치(파라미터) 역시 공개되었다. 이 새로운 모델을 통해 중국은 능력, 비용, 개방성이라는 세 가지 측면에서 경쟁하고 있다. 이번 제안은 매우 매력적이며 시기적절해 보인다.
최근 몇 주간 미국 기업들은 직원 1인당 수천 달러에 달하는 치솟는 AI 비용으로 골머리를 앓고 있다. 일부 기업은 토큰(모델이 처리하는 텍스트 단위) 사용 예산을 책정하고 있다. 그러던 중 6월 12일, 트럼프 행정부는 미국인 외 사용자의 페이블 5 사용을 금지했고, 앤스로픽은 해당 모델의 서비스를 중단해야 했다. 최첨단 AI에 대한 접근성이 한 정부의 결정에 좌우되는 상황이 처음으로 발생한 것이다. 이 모든 상황은 사용자들이 미국 AI의 대안을 찾게 만드는 이유가 될 수 있다. 많은 이들이 GLM 5.2의 성능과 가격 경쟁력을 확인하고, 트럼프 행정부의 손이 닿지 않는다는 점을 환영할 것이다.
먼저 성능부터 살펴보자. 연구 기관인 아티피셜 애널리시스(Artificial Analysis)는 GLM 5.2를 시장에서 가장 지능적인 오픈소스 모델로 평가했다. GLM 5.2는 오픈AI의 챗GPT 5.5에 이어, 구글의 제미나이 봇을 제치고 전체 순위에서 인상적인 4위를 차지했다. 이 모델은 모두를 놀라게 했다. 올해 초 중국 개발자들은 2030년 이전에 자신들의 모델이 미국 모델을 뛰어넘을 가능성에 대해 비관적이었다. 지푸의 출시 이후, 일론 머스크는 자신의 소셜 미디어인 X에 중국이 내년 초까지 현재의 최첨단 AI 능력과 대등한 수준에 이를 것으로 예상한다고 적었다. 이에 지푸의 공동 창업자인 탕지에(Tang Jie)는 "그렇게 오래 걸리지 않을 것"이라고 맞받아쳤다.
중량감 있는 계산
딥시크 때와 달리, 미국 시장은 아직 GLM 5.2에 큰 관심을 보이지 않고 있다. 이는 부분적으로 중국 모델을 정확하게 평가하기가 더 어려워졌기 때문이다. 아티피셜 애널리시스는 GLM 5.2의 점수를 산출하기 위해 수십 개의 벤치마크 테스트를 실시했는데, 이는 시험 문제와 유사한 방식으로 모델의 지능을 평가한다. 앤스로픽을 앞세운 미국은 성능 면에서 우위를 유지하고 있다. 평균적인 벤치마크 작업에서 페이블 5는 GLM 5.2보다 약 17% 더 똑똑하다. 또 다른 중요한 지표는 GLM 5.2가 이 정도 지능 수준에 도달하는 데 걸린 시간이다. GLM 5.2와 비교할 만한 서구권 모델은 약 4개월 전인 2월에 출시되었다.
실제로는 미국의 격차가 4개월보다 더 클 가능성이 높다. 노르웨이 국방연구소(FFI)의 하바드 트베이트 일레(Havard Tveit Ihle) 박사는 다수의 중국 모델을 포함한 오픈소스 모델들이 비공개 벤치마크보다 공개 벤치마크에서 더 좋은 점수를 받는 경향이 있다고 말한다. 공개 벤치마크 테스트에 사용되는 질문들은 대중에게 공개되지만, 비공개 벤치마크를 적용하는 곳들은 평가 방식을 비밀로 유지하기 때문이다. 트베이트 일레 박사가 GLM 5.2 출시 전에 발표한 분석에 따르면, 중국 모델들은 공개 테스트에서 미국 모델보다 약 4~6개월 뒤처져 있었지만, 비공개 테스트에서는 미국의 우위가 8~10개월로 거의 두 배 가까이 벌어졌다(차트 참조). 지난 5월에 발표된 미국 정부의 연구도 비슷한 격차를 확인했다. 트베이트 일레 박사는 중국 연구소들이 의도했든 아니든, "시험을 위한 교육(test-taking prep)"을 하는 것으로 보인다고 지적한다.
모범생
지금까지 테스트된 두 가지 비공개 벤치마크에서 GLM 5.2는 같은 특징을 보여준다. 세심한 추론이 필요한 비정형 머신러닝 과제를 측정하는 '위어드ML(WeirdML)'에서는 약 7개월, 모델을 속여 상식을 평가하는 '심플벤치(SimpleBench)'에서는 꼬박 1년 뒤처져 있다. 하지만 이런 패턴이 일관된 것은 아니다. 6월 19일 아티피셜 애널리시스가 발표한 새로운 시험은 지저분한 파일을 분류하고 상충하는 정보를 평가하는 등 사무 업무를 모델에게 테스트했다. GLM 5.2는 이 평가를 위해 따로 훈련할 수 없었을 것이다. 그런데도 출시된 지 2개월밖에 안 된 챗GPT 5.5를 능가했다. 트베이트 일레 박사는 이러한 결과가 미국의 우위가 여전히 견고하다는 것을 보여주지만, 동시에 격차가 예상만큼 벌어지지 않고 있다는 증거이기도 하다고 말한다.
GLM 5.2에서 특히 놀라운 점은 동료 모델들이 자주 실수하는 과제에서 성공한다는 것이다. 중국 모델들은 수학이나 코딩처럼 정답이 명확한 분야에서 탁월한 성능을 보이는 경우가 많았다. 그러나 개방형 문제이거나 지속적인 독자적 판단이 필요한 문제에서는 무너지는 경향이 있었다. 이러한 패턴은 중국 연구원들이 직면한 가장 큰 과제 중 하나를 반영한다. 첨단 칩에 대한 수출 통제로 인해 중국 연구소들은 가장 강력한 모델을 훈련하는 데 필요한 컴퓨팅 파워가 부족하다. 그래서 그들은 사후 학습(post-training)을 통해 격차를 메우려는 경향이 있다. 즉, 모델을 특정 방식으로 행동하게 하거나 특정 유형의 문제를 해결하도록 미세 조정(fine-tuning)하는 것인데, 여기에는 "증류(distillation)" 과정을 통해 미국 시스템에서 추출한 것으로 알려진 데이터도 포함된다.
중국 모델의 실제 능력에 대한 불확실성을 고려할 때, 다음으로는 과연 그들이 미국 경쟁사들보다 실제로 저렴한지 따져봐야 한다. 딥시크는 자사 v4 모델의 출력 토큰 100만 개당 0.87달러만 청구하는 반면, 앤스로픽은 페이블 5에 대해 같은 조건으로 50달러를 청구한다. 일부 기업의 토큰 비용이 통제 불능 상태에 빠진 미국에서 이러한 가격은 점점 더 큰 매력으로 다가올 수 있다. 송장 처리 업체인 램프(Ramp)에 따르면, 6월 들어 미국 기업들 사이에서 딥시크 서비스를 이용하는 사례가 급증했다. 보도에 따르면 마이크로소프트는 자사의 핵심 챗봇인 코파일럿(Copilot)에 이 중국 연구소의 모델을 사용하는 것을 고려하고 있다고 한다. 하지만 중국 AI가 더 저렴하다는 이 가장 중요한 가정은 종종 틀릴 수 있다.
중국 모델의 성능은 향상되고 있지만, 일반적으로 효율성까지 좋아지고 있는 것은 아니다. 중국 모델들은 답변을 도출하기 위해 훨씬 더 많은 토큰을 사용한다. 조지아 공대의 두정(Du Zheng)과 공동 저자들이 이번 달에 업데이트한 연구에 따르면, 동일한 과제를 수행했을 때 딥시크 모델은 오픈AI의 경쟁 모델보다 기본적인 결과를 얻기 위해 23배 더 많은 토큰을 사용했다. 효율성 면에서 이러한 큰 차이가 있기 때문에 모델을 비교하는 올바른 방법은 토큰당 가격이 아니라 사용된 모든 토큰의 총비용이다. 이 지표를 사용하여 소프트웨어 엔지니어링을 테스트하기 위해 설계된 벤치마크를 적용해 보면, GLM 5.2는 결국 앤스로픽이나 오픈AI의 시스템보다 더 많은 비용이 드는 것으로 나타났다.
성능과 비용 외에도, AI 사용자들에게 현재 가장 중요한 세 번째 구매 포인트는 신뢰성이다. 지푸는 트럼프 행정부가 앤스로픽에 페이블 5의 비미국인 사용을 금지하라고 통보한 다음 날인 6월 13일 오후 5시 21분(베이징 시간)에 모델을 출시했다. 탕지에는 "우리의 태도는 철저한 개방성"이라고 선언했다. 그는 또한 앤스로픽과 미국 정부가 부과한 것과 같은 "외부 봉쇄"를 비난하며, 이런 조치가 AI 시스템을 "언제든 폐쇄될 수 있는 상태"로 만든다고 말했다. 페이블 5의 서비스 중단 사태는 전 세계 기업들이 미국 AI에 대한 의존도를 재고하게 만들면서 중국 연구소들에 도움이 될 수 있다.
대부분의 중국 모델은 오픈소스로 출시되어 로컬 하드웨어에서 다운로드하여 실행할 수 있기 때문에 정부나 연구소 자체의 영향력에서 벗어나 있다. 하지만 미국 정부는 언젠가 중국 AI의 국내 사용을 제한할 수도 있다. 현재 두 개의 의회 위원회가 중국 모델을 사용하는 미국 기술 기업들을 조사하고 있다. 또한 중국 연구소들은 다른 한계에도 직면해 있다. 컴퓨팅 파워 부족으로 인해 서비스 중단이 잦거나, 트래픽이 몰릴 때 속도가 느려지기도 한다.
AI 경쟁이 가속화됨에 따라 전 세계 규제 당국은 안전과 보안이라는 새로운 도전에 직면하게 될 것이다. 갑작스러운 정부 개입의 위험은 커질 수 있다. 페이블 5는 그러한 대응을 촉발할 만큼 강력했다. 현재 중국 모델들이 비슷한 규제 리스크에 직면해 있지 않다는 점은 중국 정부가 아직 행동에 나설 만큼 위기감을 느끼지 못하고 있음을 시사한다. 이는 중국이 여전히 경쟁자들보다 뒤처져 있다는 가장 명확한 증거 중 하나일 수 있다.
새로운 모델이 중국 AI의 가치에 대한 재평가를 강요하고 있다.
인공지능 분야에서 미국의 대중국 우위가 지난 1년여 만에 가장 좁혀졌을지도 모른다. 2025년 1월, 중국이 '딥시크 R1(DeepSeek R1)'을 출시하며 AI 경쟁 구도를 뒤흔들었을 때, 미국 자본시장에서 1조 달러가 증발했다. 칩 제조사 엔비디아의 주가는 한때 17% 하락했고, 나스닥은 하루 만에 3.1% 급락했다. 미국 투자자들이 불안해했던 것은 중국의 AI가 뛰어났기 때문만이 아니라, 그것이 무료로 제공되었기 때문이었다. 소동은 곧 사그라들었지만, 그 이후로 전 세계 시장 가치는 AI가 혁명적이면서도 수익성까지 갖출 것이라는 기대에 더욱 크게 의존하게 되었다.
이제 중국 연구소들은 모델 시장을 독점하려는 경쟁 속에서 다시 한번 미국 라이벌들을 불안하게 만들고 있다. 6월 13일, 베이징 기반의 연구소 지푸(Zhipu, 또는 Z.ai)는 최신 시스템인 GLM 5.2를 발표하며 "모두를 위한 최첨단 지능에 한 걸음 더 다가섰다"고 공언했다. 이는 지금까지 출시된 중국산 훈련 모델 중 가장 뛰어난 성능을 자랑하며, 앤스로픽의 최신 모델인 '페이블 5(Fable 5)' 가격의 10분의 1 미만으로 작동한다. 다른 중국 모델들과 마찬가지로 GLM 5.2의 작동을 가능하게 하는 가중치(파라미터) 역시 공개되었다. 이 새로운 모델을 통해 중국은 능력, 비용, 개방성이라는 세 가지 측면에서 경쟁하고 있다. 이번 제안은 매우 매력적이며 시기적절해 보인다.
최근 몇 주간 미국 기업들은 직원 1인당 수천 달러에 달하는 치솟는 AI 비용으로 골머리를 앓고 있다. 일부 기업은 토큰(모델이 처리하는 텍스트 단위) 사용 예산을 책정하고 있다. 그러던 중 6월 12일, 트럼프 행정부는 미국인 외 사용자의 페이블 5 사용을 금지했고, 앤스로픽은 해당 모델의 서비스를 중단해야 했다. 최첨단 AI에 대한 접근성이 한 정부의 결정에 좌우되는 상황이 처음으로 발생한 것이다. 이 모든 상황은 사용자들이 미국 AI의 대안을 찾게 만드는 이유가 될 수 있다. 많은 이들이 GLM 5.2의 성능과 가격 경쟁력을 확인하고, 트럼프 행정부의 손이 닿지 않는다는 점을 환영할 것이다.
먼저 성능부터 살펴보자. 연구 기관인 아티피셜 애널리시스(Artificial Analysis)는 GLM 5.2를 시장에서 가장 지능적인 오픈소스 모델로 평가했다. GLM 5.2는 오픈AI의 챗GPT 5.5에 이어, 구글의 제미나이 봇을 제치고 전체 순위에서 인상적인 4위를 차지했다. 이 모델은 모두를 놀라게 했다. 올해 초 중국 개발자들은 2030년 이전에 자신들의 모델이 미국 모델을 뛰어넘을 가능성에 대해 비관적이었다. 지푸의 출시 이후, 일론 머스크는 자신의 소셜 미디어인 X에 중국이 내년 초까지 현재의 최첨단 AI 능력과 대등한 수준에 이를 것으로 예상한다고 적었다. 이에 지푸의 공동 창업자인 탕지에(Tang Jie)는 "그렇게 오래 걸리지 않을 것"이라고 맞받아쳤다.
중량감 있는 계산
딥시크 때와 달리, 미국 시장은 아직 GLM 5.2에 큰 관심을 보이지 않고 있다. 이는 부분적으로 중국 모델을 정확하게 평가하기가 더 어려워졌기 때문이다. 아티피셜 애널리시스는 GLM 5.2의 점수를 산출하기 위해 수십 개의 벤치마크 테스트를 실시했는데, 이는 시험 문제와 유사한 방식으로 모델의 지능을 평가한다. 앤스로픽을 앞세운 미국은 성능 면에서 우위를 유지하고 있다. 평균적인 벤치마크 작업에서 페이블 5는 GLM 5.2보다 약 17% 더 똑똑하다. 또 다른 중요한 지표는 GLM 5.2가 이 정도 지능 수준에 도달하는 데 걸린 시간이다. GLM 5.2와 비교할 만한 서구권 모델은 약 4개월 전인 2월에 출시되었다.
실제로는 미국의 격차가 4개월보다 더 클 가능성이 높다. 노르웨이 국방연구소(FFI)의 하바드 트베이트 일레(Havard Tveit Ihle) 박사는 다수의 중국 모델을 포함한 오픈소스 모델들이 비공개 벤치마크보다 공개 벤치마크에서 더 좋은 점수를 받는 경향이 있다고 말한다. 공개 벤치마크 테스트에 사용되는 질문들은 대중에게 공개되지만, 비공개 벤치마크를 적용하는 곳들은 평가 방식을 비밀로 유지하기 때문이다. 트베이트 일레 박사가 GLM 5.2 출시 전에 발표한 분석에 따르면, 중국 모델들은 공개 테스트에서 미국 모델보다 약 4~6개월 뒤처져 있었지만, 비공개 테스트에서는 미국의 우위가 8~10개월로 거의 두 배 가까이 벌어졌다(차트 참조). 지난 5월에 발표된 미국 정부의 연구도 비슷한 격차를 확인했다. 트베이트 일레 박사는 중국 연구소들이 의도했든 아니든, "시험을 위한 교육(test-taking prep)"을 하는 것으로 보인다고 지적한다.
모범생
지금까지 테스트된 두 가지 비공개 벤치마크에서 GLM 5.2는 같은 특징을 보여준다. 세심한 추론이 필요한 비정형 머신러닝 과제를 측정하는 '위어드ML(WeirdML)'에서는 약 7개월, 모델을 속여 상식을 평가하는 '심플벤치(SimpleBench)'에서는 꼬박 1년 뒤처져 있다. 하지만 이런 패턴이 일관된 것은 아니다. 6월 19일 아티피셜 애널리시스가 발표한 새로운 시험은 지저분한 파일을 분류하고 상충하는 정보를 평가하는 등 사무 업무를 모델에게 테스트했다. GLM 5.2는 이 평가를 위해 따로 훈련할 수 없었을 것이다. 그런데도 출시된 지 2개월밖에 안 된 챗GPT 5.5를 능가했다. 트베이트 일레 박사는 이러한 결과가 미국의 우위가 여전히 견고하다는 것을 보여주지만, 동시에 격차가 예상만큼 벌어지지 않고 있다는 증거이기도 하다고 말한다.
GLM 5.2에서 특히 놀라운 점은 동료 모델들이 자주 실수하는 과제에서 성공한다는 것이다. 중국 모델들은 수학이나 코딩처럼 정답이 명확한 분야에서 탁월한 성능을 보이는 경우가 많았다. 그러나 개방형 문제이거나 지속적인 독자적 판단이 필요한 문제에서는 무너지는 경향이 있었다. 이러한 패턴은 중국 연구원들이 직면한 가장 큰 과제 중 하나를 반영한다. 첨단 칩에 대한 수출 통제로 인해 중국 연구소들은 가장 강력한 모델을 훈련하는 데 필요한 컴퓨팅 파워가 부족하다. 그래서 그들은 사후 학습(post-training)을 통해 격차를 메우려는 경향이 있다. 즉, 모델을 특정 방식으로 행동하게 하거나 특정 유형의 문제를 해결하도록 미세 조정(fine-tuning)하는 것인데, 여기에는 "증류(distillation)" 과정을 통해 미국 시스템에서 추출한 것으로 알려진 데이터도 포함된다.
중국 모델의 실제 능력에 대한 불확실성을 고려할 때, 다음으로는 과연 그들이 미국 경쟁사들보다 실제로 저렴한지 따져봐야 한다. 딥시크는 자사 v4 모델의 출력 토큰 100만 개당 0.87달러만 청구하는 반면, 앤스로픽은 페이블 5에 대해 같은 조건으로 50달러를 청구한다. 일부 기업의 토큰 비용이 통제 불능 상태에 빠진 미국에서 이러한 가격은 점점 더 큰 매력으로 다가올 수 있다. 송장 처리 업체인 램프(Ramp)에 따르면, 6월 들어 미국 기업들 사이에서 딥시크 서비스를 이용하는 사례가 급증했다. 보도에 따르면 마이크로소프트는 자사의 핵심 챗봇인 코파일럿(Copilot)에 이 중국 연구소의 모델을 사용하는 것을 고려하고 있다고 한다. 하지만 중국 AI가 더 저렴하다는 이 가장 중요한 가정은 종종 틀릴 수 있다.
중국 모델의 성능은 향상되고 있지만, 일반적으로 효율성까지 좋아지고 있는 것은 아니다. 중국 모델들은 답변을 도출하기 위해 훨씬 더 많은 토큰을 사용한다. 조지아 공대의 두정(Du Zheng)과 공동 저자들이 이번 달에 업데이트한 연구에 따르면, 동일한 과제를 수행했을 때 딥시크 모델은 오픈AI의 경쟁 모델보다 기본적인 결과를 얻기 위해 23배 더 많은 토큰을 사용했다. 효율성 면에서 이러한 큰 차이가 있기 때문에 모델을 비교하는 올바른 방법은 토큰당 가격이 아니라 사용된 모든 토큰의 총비용이다. 이 지표를 사용하여 소프트웨어 엔지니어링을 테스트하기 위해 설계된 벤치마크를 적용해 보면, GLM 5.2는 결국 앤스로픽이나 오픈AI의 시스템보다 더 많은 비용이 드는 것으로 나타났다.
성능과 비용 외에도, AI 사용자들에게 현재 가장 중요한 세 번째 구매 포인트는 신뢰성이다. 지푸는 트럼프 행정부가 앤스로픽에 페이블 5의 비미국인 사용을 금지하라고 통보한 다음 날인 6월 13일 오후 5시 21분(베이징 시간)에 모델을 출시했다. 탕지에는 "우리의 태도는 철저한 개방성"이라고 선언했다. 그는 또한 앤스로픽과 미국 정부가 부과한 것과 같은 "외부 봉쇄"를 비난하며, 이런 조치가 AI 시스템을 "언제든 폐쇄될 수 있는 상태"로 만든다고 말했다. 페이블 5의 서비스 중단 사태는 전 세계 기업들이 미국 AI에 대한 의존도를 재고하게 만들면서 중국 연구소들에 도움이 될 수 있다.
대부분의 중국 모델은 오픈소스로 출시되어 로컬 하드웨어에서 다운로드하여 실행할 수 있기 때문에 정부나 연구소 자체의 영향력에서 벗어나 있다. 하지만 미국 정부는 언젠가 중국 AI의 국내 사용을 제한할 수도 있다. 현재 두 개의 의회 위원회가 중국 모델을 사용하는 미국 기술 기업들을 조사하고 있다. 또한 중국 연구소들은 다른 한계에도 직면해 있다. 컴퓨팅 파워 부족으로 인해 서비스 중단이 잦거나, 트래픽이 몰릴 때 속도가 느려지기도 한다.
AI 경쟁이 가속화됨에 따라 전 세계 규제 당국은 안전과 보안이라는 새로운 도전에 직면하게 될 것이다. 갑작스러운 정부 개입의 위험은 커질 수 있다. 페이블 5는 그러한 대응을 촉발할 만큼 강력했다. 현재 중국 모델들이 비슷한 규제 리스크에 직면해 있지 않다는 점은 중국 정부가 아직 행동에 나설 만큼 위기감을 느끼지 못하고 있음을 시사한다. 이는 중국이 여전히 경쟁자들보다 뒤처져 있다는 가장 명확한 증거 중 하나일 수 있다.