Las TPU de Google comienzan a rivalizar con las GPU Blackwell de NVIDIA en uno de los aspectos que más preocupa a los que operan grandes modelos de inteligencia artificial: cuánto cuesta generar cada millón de tokens. Las primeras pruebas independientes realizadas por SemiAnalysis con TPUv7 Ironwood muestran ventajas en coste frente a B200 y B300 en diversos escenarios, mientras Google prepara TorchTPU para eliminar una de las principales barreras para su adopción: el soporte nativo de PyTorch.
Resumen rápido: TPU vs NVIDIA en 20 segundos
- SemiAnalysis comparó TPUv7 Ironwood con NVIDIA B200 y B300 en inferencia de grandes modelos.
- A 100 tokens/segundo por usuario, Ironwood cuesta un 19 % menos que B200 y un 34 % menos que B300.
- En ciertos casos, ofrece hasta un 50 % más de rendimiento por dólar.
- TorchTPU permitirá usar PyTorch de forma nativa sobre las TPU.
Este resultado no implica que Google haya desarrollado un acelerador siempre más rápido que Blackwell. NVIDIA mantiene ventajas significativas en ciertos escenarios, y TPUv7 no soporta cálculo FP4 nativo. Lo importante es otra métrica: la relación entre rendimiento, latencia y coste, que se ha convertido en uno de los principales campos de batalla para infraestructuras de IA.
Ironwood entra en la carrera por el coste por token
SemiAnalysis publicó en InferenceX sus primeras pruebas independientes de inferencia con TPUv7 Ironwood, comparándola en igualdad de precisión FP8 con las NVIDIA B200 y B300.
Los resultados varían bastante según la carga y la latencia requerida, por lo que reducir la comparación a un solo porcentaje sería engañoso.
A una velocidad de generación de 100 tokens por segundo y usuario, SemiAnalysis calcula un coste aproximado de 0,181 dólares por millón de tokens para Ironwood, frente a 0,222 dólares para B200 y 0,276 dólares para B300. Esto implica una ventaja de aproximadamente el 19 % respecto a B200 y del 34 % frente a B300.
| Escenario analizado | TPUv7 Ironwood | NVIDIA B200 | NVIDIA B300 |
|---|---|---|---|
| 100 tokens/segundo/usuario | 0,181 $/M tokens | 0,222 $/M | 0,276 $/M |
| Diferencia respecto a TPU | — | TPU aproximadamente 19 % más barato | TPU aproximadamente 34 % más barato |
| Respuesta media de 20 s | ~0,098 $/M | ~0,106 $/M | ~0,132 $/M |
| Precisión comparada | FP8 | FP8 | FP8 |
Existen puntos en la curva donde la diferencia se amplía aún más. A 20 tokens por segundo y usuario, SemiAnalysis reportó 9.364 tokens/segundo por chip en Ironwood, frente a 8.903 en B200 y 8.925 en B300.
Combinando ese rendimiento con su estimación del coste por hora, el análisis calcula un 50,4 % más de tokens por dólar que B200 y un 96 % más que B300 en ese escenario específico. La precisión es clave: esas diferencias no se pueden extrapolar automáticamente a cualquier modelo, latencia o configuración.
También hay escenarios donde Blackwell mantiene ventajas. SemiAnalysis reconoce que B200 supera a Ironwood en parte de la curva, y que configuraciones como GB200/GB300 NVL72 siguen siendo competitivas mientras el software externo para inferencia en TPU sigue madurando.
La primera conclusión es que ya no se puede reducir la discusión solo a qué acelerador ofrece más FLOPS o más tokens por segundo. Para un proveedor que gestiona miles de millones de tokens, unos céntimos de diferencia por cada millón pueden tener un impacto significativo en el coste total de la infraestructura.
TorchTPU desafía una de las mayores ventajas de NVIDIA
El hardware es solo una parte del problema. NVIDIA ha construido durante años una ventaja gracias a CUDA y a un ecosistema de software ampliamente adoptado por desarrolladores, investigadores y proveedores de inferencia.
Google necesitaba reducir esa barrera.
Aquí entra TorchTPU, un nuevo backend que busca que las TPU funcionen con PyTorch como si fuera un dispositivo nativo. Google explica que los desarrolladores podrán trabajar con tensores estándar de PyTorch en un dispositivo tpu, manteniendo interfaces conocidas y utilizando torch.compile cuando sea necesario.
Por debajo, siguen presentes tecnologías propias del entorno TPU, como XLA, StableHLO y kernels especializados. Por tanto, “PyTorch nativo” no significa que Google haya eliminado su arquitectura de software, sino que intenta hacerla mucho menos visible para el desarrollador.
Este cambio puede tener efectos que van más allá de una simple mejora en la comodidad.
vLLM y SGLang son dos de los proyectos más utilizados para desplegar modelos de lenguaje en producción. Si ambos pueden tratar las TPU como dispositivos de PyTorch de primera clase, Google reduce el trabajo necesario para adaptar nuevos modelos abiertos a su hardware.
Google ya confirmó en abril que TorchTPU usa la interfaz PrivateUse1 de PyTorch y que trabaja en integraciones profundas con proyectos como vLLM. También prepara un repositorio público y mejoras en enfoques dinámicos, kernels personalizados y ejecución distribuida.
SemiAnalysis indica que TorchTPU sigue en beta privada y estima que su versión de código abierto estará lista alrededor de octubre. Además, señala a Qwen3.5-397B como uno de los primeros grandes modelos utilizados para ajustar este entorno.
La TPUv8 añadirá FP4 y aumentará la presión sobre Blackwell
Ironwood todavía tiene una limitación importante frente a las GPU Blackwell: no soporta cálculo FP4 nativo.
Esto es relevante porque B200 y B300 pueden usar FP4 para incrementar notablemente el rendimiento en inferencia, aunque reducir la precisión de FP8 puede afectar la calidad del modelo. Por eso, SemiAnalysis compara principalmente en FP8 con FP8.
La situación cambiará con la octava generación de TPU.
Google ya presentó dos versiones: TPU 8t, enfocada en entrenamiento, y TPU 8i, diseñada para inferencia, post-entrenamiento y razonamiento. TPU 8i tendrá 288 GB de HBM, 384 MB de SRAM integrada y cálculo FP4 con un máximo de 10,1 PFLOPS de rendimiento.
También lanzará Boardfly, una nueva topología de interconexión que reemplaza el diseño de toro 3D de Ironwood para inferencia. Google asegura que este cambio reduce de 16 a 7 los saltos necesarios en una configuración de 1024 chips, mejorando hasta un 80 % el rendimiento por dólar frente a Ironwood en tareas de baja latencia.
TPU 8i todavía aparece como “disponible próximamente”, por lo que esas cifras corresponden a anuncios de Google y no a resultados independientes publicados por SemiAnalysis para Ironwood.
Otra pieza clave es la posibilidad de alquilar y llegar a clientes específicos con TPU. SemiAnalysis sostiene que Ironwood marca una nueva etapa donde las TPU no solo se pueden alquilar en Google Cloud, sino también adquirir directamente. Si esta distribución se extiende, PyTorch dejará de ser una barrera, y Google podrá hacer que vLLM y SGLang funcionen para otros clientes, poniendo en jaque a la TPU tradicional de Google Cloud.
Esto no significa el fin del dominio de NVIDIA. Blackwell sigue contando con un software muy maduro, una amplia base instalada y ventajas técnicas en diversos casos. Pero la economía de la inferencia está cambiando: ya no basta con tener el acelerador más rápido; ahora importa cuánto tokens puedes producir por euro y por vatio.
Preguntas frecuentes
¿Son las TPUv7 de Google más económicas que las NVIDIA B200 y B300?
Según las pruebas de SemiAnalysis, Ironwood ofrece un menor coste por millón de tokens en varios puntos de la curva analizada. Sin embargo, la ventaja varía según la carga, la latencia y la configuración; por ello, no hay un porcentaje único aplicable a todos los escenarios.
¿Qué es TorchTPU?
TorchTPU es un nuevo entorno diseñado para usar las TPU de Google como dispositivos nativos en PyTorch. Su objetivo es reducir la brecha entre el desarrollo para GPU y TPU, facilitando la integración con herramientas como vLLM.
¿Puede TPUv7 usar FP4?
Ironwood actualmente no soporta cálculo FP4 nativo. Por eso, SemiAnalysis emplea FP8 para su comparativa con B200 y B300. La versión TPU 8i sí soportará aceleración FP4.
¿Cuándo estará disponible TPU 8i?
Google anunció TPU 8i y detalló su arquitectura, pero a 09/09/2026 todavía la presenta como “disponible próximamente” para clientes de Google Cloud.
Vía: newsletter SemiAnalysis. Imagen de Google.
