
El 10 de agosto de 2026, la cuenta de tiny corp (@tinygrad), la empresa detrás del proyecto tinygrad fundada por George Hotz, publicó un tweet que generó bastante revuelo en la comunidad de IA local: lograron correr Qwen 3.6 27B, un modelo de lenguaje de 27 mil millones de parámetros, sobre una GPU AMD 7900XTX conectada simplemente por USB3, alcanzando 34 tokens por segundo.
La frase que acompaña la demo lo resume todo: “literalmente cualquier computadora hecha en los últimos 10 años” puede correr esto. No hace falta una motherboard gamer de última generación, ni slots PCIe libres, ni un case gigante: alcanza con un puerto USB.
Antes de seguir, vale la pena aclarar la unidad de medida, porque no es exactamente lo mismo que “palabras”.
Un token es la unidad mínima de texto que un modelo de lenguaje procesa internamente. No siempre es una palabra completa: puede ser una palabra corta, un pedazo de una palabra más larga, un signo de puntuación o un espacio. Los modelos no “piensan” en palabras, sino en estos fragmentos.
Como referencia aproximada:
Entonces, cuando tiny corp dice 34 tokens/segundo, en la práctica eso ronda las 20-25 palabras por segundo en español (más en inglés). Para ponerlo en contexto: una persona lee en promedio entre 3 y 5 palabras por segundo, así que 34 tok/s es una velocidad muy por encima de lo que un humano puede leer en tiempo real, lo cual es más que suficiente para que la respuesta del modelo se sienta fluida y no como si estuviera “tipeando” lento.
Hasta ahora, meter una GPU potente en una compu para correr modelos de IA localmente implicaba pelear con:
Al mover esa conexión a USB3, tiny corp le baja drásticamente la barrera de entrada al hardware necesario: una laptop de oficina, una mini PC, o cualquier equipo viejo con un puerto USB pasa a ser, en teoría, una plataforma viable para correr modelos grandes de forma local.
Junto con la demo, confirmaron que el 12 de agosto lanzan el dock eGPU que hace esto posible, con dos detalles que le gustaron mucho a la comunidad:
Esto no es una idea improvisada: ya el 1 de agosto habían adelantado la configuración recomendada para tener “inteligencia usable” tipo Qwen3.6-27B en casa: una AMD 7900 XTX (que describen como “la mejor relación precio-rendimiento en GPUs desde hace 3 años”), una fuente ATX, y una computadora con puerto USB.
Las respuestas al tweet muestran el interés (y el humor) típico de la comunidad de IA local:
Uno de los comentarios más citados resume el punto central del anuncio en una sola línea: 34 tokens por segundo sobre USB3 en hardware de consumo es toda la señal que hace falta. No se trata solo de un número de rendimiento: es una prueba de concepto de que correr modelos grandes de IA en casa, sin hardware exótico ni presupuesto de servidor, está cada vez más al alcance de cualquiera.
Si esto se confirma con el lanzamiento del 12 de agosto y el ecosistema de firmware open source crece alrededor de este dock, podríamos estar viendo el inicio de una nueva ola de setups de IA local mucho más accesibles que los actuales.
Nota: este artículo está basado en un hilo de respuestas públicas en X (Twitter) del 10 de agosto de 2026. Los datos de rendimiento provienen de pruebas informadas por usuarios en los comentarios y no están verificados de forma independiente.