https://archive.is/E2rPf

https://archive.is/KV9SR

https://archive.is/rRwB1

34 tokens/segundo por un cable USB: tiny corp quiere democratizar la IA local

El 10 de agosto de 2026, la cuenta de tiny corp (@tinygrad), la empresa detrás del proyecto tinygrad fundada por George Hotz, publicó un tweet que generó bastante revuelo en la comunidad de IA local: lograron correr Qwen 3.6 27B, un modelo de lenguaje de 27 mil millones de parámetros, sobre una GPU AMD 7900XTX conectada simplemente por USB3, alcanzando 34 tokens por segundo.

La frase que acompaña la demo lo resume todo: “literalmente cualquier computadora hecha en los últimos 10 años” puede correr esto. No hace falta una motherboard gamer de última generación, ni slots PCIe libres, ni un case gigante: alcanza con un puerto USB.

¿Qué es un “token” y por qué se mide en tokens/segundo?

Antes de seguir, vale la pena aclarar la unidad de medida, porque no es exactamente lo mismo que “palabras”.

Un token es la unidad mínima de texto que un modelo de lenguaje procesa internamente. No siempre es una palabra completa: puede ser una palabra corta, un pedazo de una palabra más larga, un signo de puntuación o un espacio. Los modelos no “piensan” en palabras, sino en estos fragmentos.

Como referencia aproximada:

  • En inglés, 100 tokens equivalen más o menos a 75 palabras.
  • En español, por las tildes y la morfología del idioma, la relación suele ser un poco menos eficiente: cerca de 0.6-0.7 palabras por token.

Entonces, cuando tiny corp dice 34 tokens/segundo, en la práctica eso ronda las 20-25 palabras por segundo en español (más en inglés). Para ponerlo en contexto: una persona lee en promedio entre 3 y 5 palabras por segundo, así que 34 tok/s es una velocidad muy por encima de lo que un humano puede leer en tiempo real, lo cual es más que suficiente para que la respuesta del modelo se sienta fluida y no como si estuviera “tipeando” lento.

¿Por qué importa esto?

Hasta ahora, meter una GPU potente en una compu para correr modelos de IA localmente implicaba pelear con:

  • Slots PCIe disponibles (y del ancho de banda correcto)
  • Fuentes de poder compatibles
  • Gabinetes con espacio físico
  • Compatibilidad de placa madre

Al mover esa conexión a USB3, tiny corp le baja drásticamente la barrera de entrada al hardware necesario: una laptop de oficina, una mini PC, o cualquier equipo viejo con un puerto USB pasa a ser, en teoría, una plataforma viable para correr modelos grandes de forma local.

El producto: un dock eGPU open source

Junto con la demo, confirmaron que el 12 de agosto lanzan el dock eGPU que hace esto posible, con dos detalles que le gustaron mucho a la comunidad:

  1. Firmware 100% open source, algo poco común en este tipo de hardware.
  2. Un puerto USB adicional dedicado a modo serie, pensado exclusivamente para poder reflashear o recuperar el dispositivo si algo sale mal. Le llaman “unbrickability”: básicamente, la garantía de que nunca vas a dejar el dock inutilizable.

Esto no es una idea improvisada: ya el 1 de agosto habían adelantado la configuración recomendada para tener “inteligencia usable” tipo Qwen3.6-27B en casa: una AMD 7900 XTX (que describen como “la mejor relación precio-rendimiento en GPUs desde hace 3 años”), una fuente ATX, y una computadora con puerto USB.

Lo que dice la comunidad

Las respuestas al tweet muestran el interés (y el humor) típico de la comunidad de IA local:

  • Varios preguntan cómo escalaría esto a múltiples GPUs: ¿un puerto USB por tarjeta? ¿usando un hub? ¿subirán de precio los hubs USB ante la demanda?
  • Comparaciones con soluciones existentes de eGPU vía Oculink, que varios usuarios ya usan como alternativa.
  • Reportes de rendimiento variando según la cuantización del modelo: un usuario contó que con la GPU instalada de forma tradicional (no por USB) llegó a 39 tok/s, con un modelo MTP de Unsloth a 50 tok/s, y con una versión de 1 bit (“bonsai”) hasta 70 tok/s, aunque advierte que esta última pierde bastante calidad de respuesta.
  • Preguntas recurrentes sobre precio (MSRP), disponibilidad para comprar el arnés/dock, y si combinaría bien con otro hardware como un Strix Halo para modelos más grandes.
  • Un desarrollador aprovechó para promocionar zinc, su propio motor de inferencia escrito en Zig para GPUs AMD y Apple Silicon, que según él da mejores resultados.

La conclusión de un usuario lo dice todo

Uno de los comentarios más citados resume el punto central del anuncio en una sola línea: 34 tokens por segundo sobre USB3 en hardware de consumo es toda la señal que hace falta. No se trata solo de un número de rendimiento: es una prueba de concepto de que correr modelos grandes de IA en casa, sin hardware exótico ni presupuesto de servidor, está cada vez más al alcance de cualquiera.

Si esto se confirma con el lanzamiento del 12 de agosto y el ecosistema de firmware open source crece alrededor de este dock, podríamos estar viendo el inicio de una nueva ola de setups de IA local mucho más accesibles que los actuales.


Nota: este artículo está basado en un hilo de respuestas públicas en X (Twitter) del 10 de agosto de 2026. Los datos de rendimiento provienen de pruebas informadas por usuarios en los comentarios y no están verificados de forma independiente.