OpenAI sacó su primer chip propio, llamado Jalapeño, desarrollado junto con Broadcom (fabricado por TSMC).
Puntos clave:
Sobre el tuit de tinygrad: la referencia a “toma lo mejor de GPUs y TPUs” apunta justo a ese diseño híbrido — arquitectura tipo ASIC (como las TPU de Google) pero pensada para la flexibilidad de servir múltiples familias de modelos LLM (más al estilo GPU de propósito general). Y el chiste de “clones chinos en 3 años” es sobre la dinámica típica de que el hardware se puede reproducir más rápido que el software/compiladores que lo rodean — lo cual conecta con la respuesta de @bokiko sobre que el verdadero “moat” está en el stack de serving (kernels, orquestación), no tanto en el silicio en sí.
No está a la venta — es de uso exclusivo interno de OpenAI, por ahora.
Che, hay varias cosas piolas ahí. Te tiro las más interesantes:
1. El dato técnico sobre Jalapeño (el chip de OpenAI)
“this HBM sharding is the trade-off GPUs aren’t willing to make (yet?). Memory locality is the key to power efficiency.”
Esto es la continuación del tweet que viste antes. George Hotz (tinygrad) está señalando algo técnico de fondo: Jalapeño particiona la memoria HBM de una forma que las GPUs tradicionales (Nvidia) evitan hacer, porque sacrifica flexibilidad a cambio de que los datos estén más “cerca” físicamente del cómputo. Eso reduce el consumo de energía porque mover datos por el chip cuesta más energía que el cómputo en sí. Es básicamente el mismo principio que usan las TPUs de Google — de ahí su comentario de “toma lo mejor de GPUs y TPUs”.
2. La pregunta sobre “alignment”
“¿Hay un leaderboard actualizado sobre qué IAs están más alineadas? […] si le pregunto a una IA cómo hacer metanfetaminas y me dice, eso es un problema de alineación serio. ¿Alignment = safety?”
Es una crítica filosófica interesante: él separa “seguridad” (censura/restricciones) de “alineación real” (que la IA haga lo que decís que querés, ni más ni menos). Cuestiona si la industria está confundiendo ambos conceptos.
3. Consejo sobre usar IA para revisar código
“LLMs have raised the bar for PRs […] run GPT 5.6 Sol ‘review ’ […] Don’t trust it to write or edit code, it will add many lines of nonsense.”
Postura pragmática: usa LLMs para revisar PRs antes de mandarlas, pero no confía en que el LLM escriba el código — dice que mete líneas innecesarias.
4. La joda de comprar Qualcomm
“No puedo creer que el market cap de Qualcomm sea solo 168.79B. ¿Alguien sabe si es posible un leveraged buyout? Con liderazgo nuevo que realmente quiera vender chips, fácil 5x, tendríamos un chip Qualcomm en cada robot.”
Media joda, media en serio — la idea de que Qualcomm está infravalorada y mal gestionada comercialmente para la era de “AI en cada dispositivo/robot”.
5. Benchmark del MI350X (AMD)
“High gemm MFU is possible with MI350X, this is 6710/9200 = 73%… it’s an amazing chip.”
73% de MFU (utilización efectiva del hardware) es un número muy bueno para GEMM — normalmente en el mundo real estás lejos del pico teórico. Es un elogio directo al chip de AMD, algo notable viniendo de alguien tan crítico.
6. “Chestnut” y el caso de comma.ai Lo más llamativo acá: comma.ai (empresa de manejo autónomo) instaló el “Chestnut eGPU” de tiny corp en un auto y reporta mejoras en frenado/parada más suaves. O sea, el hardware de tinygrad ya se está usando en sistemas de conducción real, no solo en benchmarks de laboratorio — eso conecta el hobby-hardware de George con aplicaciones concretas.
¿Querés que profundice en alguno en particular, tipo el tema HBM sharding o el debate de alignment?