Featured image of post 엔비디아 없이 AI 칩이 가능한가: GPU·TPU·xPU 경쟁의 진짜 셈법

엔비디아 없이 AI 칩이 가능한가: GPU·TPU·xPU 경쟁의 진짜 셈법

구글이 8세대 TPU를 내놓고도 NVIDIA GPU를 계속 사는 이유. 학습·추론용 칩 분리, 소프트웨어 장벽, NVLink Fusion과 HBM 주변 기술까지 AI 반도체 경쟁의 구조를 정리합니다.

구글은 이미 8세대 TPU까지 자체 AI 칩을 만든다. 그런데 Google Cloud에는 NVIDIA의 차세대 GPU 시스템도 계속 들어온다. 자체 칩을 여덟 세대나 쌓은 회사가 GPU를 버리지 않는다면, 질문은 단순 성능 대결이 아니다. 어떤 일이 자체 칩으로 옮겨가고, 그 주변의 연결·메모리·소프트웨어는 누가 가져가는가.

엔비디아 없이 AI 칩 가능한가? GPU·TPU·xPU 경쟁 속 진짜 셈법 분석

핵심 요약

  1. GPU도 이미 AI 전용 회로를 품는다: Tensor Core·Transformer Engine처럼 행렬 연산과 정밀도 전환을 하드웨어로 가속한다. 범용 vs 전용이라는 이분법이 흐려진다.
  2. TPU는 학습용과 추론용으로 갈라진다: 대규모 학습(TPU 8t 계열)과 토큰 단위 추론·MoE 통신(TPU 8i)은 병목이 다르다.
  3. 자체 칩의 강점은 반복 워크로드: 모델·서비스가 고정되고 같은 계산이 대량 반복될 때 유리하다. 연구·실험 단계에서는 소프트웨어 유연한 GPU가 강하다.
  4. 칩만으로는 NVIDIA를 못 대체한다: CUDA·컴파일러(XLA 등)·네트워크·랙까지 묶어야 한다. NVIDIA는 NVLink Fusion·NVHBM으로 고객 xPU 주변에도 기술을 남기려 한다.
  5. HBM 수요는 사라지지 않는다: GPU 비중이 줄어도 xPU가 다시 HBM을 요구한다. 승자는 단일 칩이 아니라 시스템 분할의 몫이다.

상세 정리

GPU 안의 전용 회로

AI 모델은 거대한 행렬곱을 반복한다. NVIDIA는 이를 일반 CUDA 코어에만 맡기지 않고, 2017년경부터 Tensor Core로 작은 행렬을 한꺼번에 처리한다. 모델이 커질수록 비트 폭도 중요해진다. 16비트를 8비트로 줄이면 같은 메모리에 더 많은 값을 담고 이동량도 줄어들지만, 너무 줄이면 정확도가 깨진다. Hopper부터 본격화된 Transformer Engine은 필요한 구간만 높은 정밀도로, 나머지는 FP8 등으로 돌리는 식이다. Blackwell에서는 더 낮은 정밀도까지 지원한다. 즉 지금의 GPU는 범용성을 남기면서 자주 나오는 AI 연산은 전용 회로로 가속한다.

TPU의 전용화와 학습·추론 분리

구글은 자주 쓰는 연산을 하드웨어에 더 세게 맞춘다. 대표가 시스톨릭 어레이다. 행렬 계산 때 데이터를 매번 메모리로 보내지 않고 연산기 사이로 흘려보낸다. 같은 형태의 행렬이 반복될 때 효율적이지만, 설계 단계에서 어떤 계산이 잦을지 어느 정도 알아야 한다. 자사 모델·추천·광고처럼 워크로드를 정확히 아는 회사에 유리한 구조다.

그런데 구글은 AI 전용칩을 다시 둘로 나눴다. 학습은 수천 칩이 한 계산을 오래 나누는 처리량 문제고, 추론은 토큰을 하나씩 이어 붙이며 KV 캐시·MoE 전문가 라우팅처럼 지연과 칩 간 통신이 병목이다. 학습용은 대규모 슈퍼팟(최대 수천~만 단위 칩 연결)에 맞춰지고, 추론용은 온칩 SRAM을 키우고 결과를 빠르게 모으는 통신(영상에서 CAE·버터플라이 연결 등으로 소개)에 힘을 준다.

자체 칩의 약점: 모델은 바뀌고 칩은 느리다

칩 설계·검증·데이터센터 투입까지 시간이 길다. 그 사이 어텐션 구조, MoE 사용법, 양자화 방식이 바뀌면 예전의 전용 회로가 쓸모없어질 수 있다. GPU는 소프트웨어·라이브러리로 새 계산을 먼저 돌려볼 수 있어 연구·실험 단계에 강하다. 반대로 모델과 서비스가 고정되고 같은 일을 대규모로 반복하면 자체 칩의 이점이 커진다. 메타 MTIA(추천·광고), 마이크로소프트 Maia(Azure 추론), AWS Trainium(학습·추론 비용), OpenAI의 Broadcom 협력 추론칩(할라페뇨로 소개)이 이 축에 있다.

특히 에이전트처럼 한 요청에 모델이 여러 번 돌면 추론 비용 압박이 커진다. 자체 추론칩은 NVIDIA 구매량을 줄이는 문제가 아니라, 같은 돈으로 더 많은 단계를 돌리려는 서비스 전략이기도 하다. 다만 칩 설계 후에도 PyTorch·CUDA 생태계에 맞추는 소프트웨어가 필요하다. 구글의 XLA는 모델 코드를 칩이 빠르게 돌릴 형태로 바꾸고, 중간 결과를 HBM에 썼다 읽는 단계를 합치는 퓨전 등으로 효율을 낸다.

NVIDIA의 대응: 가운데 칩이 바뀌어도 주변을 남긴다

빅테크가 반복 작업을 자체 칩으로 옮기면 GPU 물량 일부는 줄어들 수 있다. NVIDIA는 NVLink Fusion으로 고객 xPU·CPU도 NVLink 패브릭에 붙이게 하고, AWS Trainium과의 공동 랙 구조처럼 자체 칩과 GPU를 고르지 않고 같이 쓰는 관계를 만든다. NVHBM은 메모리 제어를 HBM 베이스 다이로 옮겨 xPU 연산 면적·대역폭·전력을 개선하려는 목표치로 소개된다(출시 후 검증 필요). 구글처럼 칩·ICI 네트워크·XLA까지 수직 통합할 수 있는 회사는 NVIDIA 의존을 줄일 수 있지만, 그 비용과 수요를 감당할 곳은 많지 않다.

HBM과 시장을 보는 눈

자체 xPU가 늘어도 HBM 수요는 사라지지 않는다. TPU·Trainium·Maia도 고대역 메모리가 필요하다. GPU 점유율이 줄어도 그 자리를 채운 xPU가 다시 HBM을 부른다. 따라서 누가 NVIDIA보다 빠른 칩을 만들었나보다, GPU가 하던 일 중 무엇이 xPU로 넘어가고 연결·메모리·소프트웨어를 누가 가져가는지를 보는 편이 맞다. 하나의 대체 칩이 등장한 게 아니라, AI 컴퓨팅 시스템이 여러 칩으로 쪼개지기 시작한 국면이다.

보는 포인트

  • 학습 vs 추론(토큰·KV 캐시·MoE) 병목 차이와 칩 분리 논리
  • CUDA/XLA 같은 소프트웨어 장벽이 하드웨어 스펙보다 큰 진입 장벽이 되는 지점
  • NVLink Fusion·NVHBM으로 그려지는 NVIDIA의 주변 기술 잠금
  • HBM이 GPU 독점 논쟁과 별도로 남는 구조적 수요

원본 정보