Sí, esa frase de Jim Keller (la dijo en el podcast de Lex Fridman, más o menos) es una simplificación brillante y bastante acertada. Vamos a desglosarla.

Qué significa la fórmula

A = B × C + D

Esto es lo que se llama una transformación afín o capa lineal, y es literalmente la operación que se repite dentro de una red neuronal:

  • C = los datos de entrada (una imagen, una palabra, un pixel… convertidos en números, en un vector o matriz)
  • B = los pesos (weights) — los números que la red “aprendió” durante el entrenamiento
  • D = el sesgo (bias) — un ajuste extra que se suma
  • A = el resultado, que pasa a la siguiente etapaEse bloque (multiplicar por B, sumar D, aplicar activación) es una sola capa. Una red neuronal moderna apila cientos de estas capas, una tras otra, y cada una tiene millones o miles de millones de números en su matriz B.

Lo que la frase de Keller simplifica (a propósito)

Falta un ingrediente clave: la activación no lineal (marcada en el diagrama). Si solo hicieras B×C+D una y otra vez sin eso, matemáticamente sería equivalente a una sola multiplicación de matrices gigante — no ganarías nada apilando capas. La no linealidad es lo que le da a la red la capacidad de aprender patrones complejos, no solo relaciones rectas.

De dónde sale el 10^18

Ese número no es la cantidad de capas, sino el número total de operaciones aritméticas (sumas y multiplicaciones, llamadas FLOPs) que hace la computadora. Se calcula así, a grandes rasgos:

(cantidad de parámetros en B y D) × (cantidad de datos de entrenamiento) × (unas cuantas pasadas)

Modelos grandes de hoy tienen decenas o cientos de miles de millones de parámetros, y se entrenan con billones de palabras o imágenes. Multiplicá eso y fácilmente llegás a 10^18, 10^23 o más — cifras que ya ni intuición humana normal maneja bien.

Entonces, ¿dónde está el “aprendizaje”?

Al principio, los números en B y D son aleatorios — la red no sabe nada. El entrenamiento consiste en:

  1. Pasar un dato por toda la cadena (esto se llama forward pass)
  2. Medir qué tan mal salió el resultado comparado con lo que debería haber sido
  3. Ajustar ligeramente los valores de B y D para que la próxima vez salga un poco mejor (esto usa backpropagation y descenso de gradiente)
  4. Repetir con millones de ejemplos, millones de veces

Con el tiempo, esos números aleatorios en B se convierten en algo que “sabe” reconocer gatos, traducir idiomas, o predecir la siguiente palabra — no porque alguien programó reglas, sino porque los valores se acomodaron solos para minimizar el error.

Lo llamativo de la observación de Keller es justamente eso: no hay magia ni “razonamiento” oculto adicional — es álgebra lineal básica, ejecutada a una escala tan brutal que el resultado parece inteligencia.

Sí, aunque no vas a encontrar esa frase textual de Keller ahí — la explicación aparece bajo otro lenguaje, más formal y matemático, en varios artículos:

  • “Red neuronal artificial” — explica la estructura básica: capas de entrada, ocultas y de salida, cómo cada nodo combina sus entradas con pesos y aplica una función de activación.
  • “Perceptrón multicapa” — el modelo concreto que corresponde a lo que dibujamos: varias capas apiladas, cada una haciendo esa suma ponderada + activación.
  • “Función de activación” — el ingrediente no lineal que Keller no menciona en su frase resumida.
  • “Retropropagación” (backpropagation) — cómo se ajustan los pesos B y D durante el entrenamiento.
  • “Aprendizaje profundo” — la idea de apilar muchas capas.

La diferencia de enfoque es esta: Wikipedia lo presenta como notación de suma (∑ wᵢxᵢ + sesgo, por cada neurona individual), que es matemáticamente lo mismo que la notación matricial A = B×C + D, solo que escrita neurona por neurona en vez de en bloque. Es más rigurosa y completa, pero menos “de un vistazo” — no vas a encontrar ahí la vuelta de tuerca coloquial de Keller sobre la escala (10^18), porque esa es una forma de hablar suya en entrevistas y podcasts, no una cifra que Wikipedia use como definición.

Si querés, te busco el artículo específico y te resumo qué dice, o te armo una comparación lado a lado entre la notación de Wikipedia (suma por neurona) y la notación matricial que usamos acá.

Ahora sí. Confirmé que el artículo “red neuronal artificial” en el aprendizaje automático es un modelo dentro de los sistemas conexionistas, inspirado en la estructura y función de las redes neuronales biológicas, y que explica que las neuronas se agrupan en capas, que las señales viajan de la capa de entrada a la de salida pasando por capas ocultas, y que una red se considera “profunda” si tiene al menos dos capas ocultas.Encontré el link de Wikipedia sobre el tema central, y de paso un par de más que complementan bien:El primero es el más directo para lo que veníamos hablando. El de Google está bueno como complemento porque tiene una demo interactiva donde vos mismo movés los números y ves por qué hace falta la no linealidad. El tercero es un caso concreto (redes convolucionales) que usa exactamente el mismo esquema de capas + pesos + activación que vimos en el diagrama, pero aplicado a imágenes.

Tenés razón, esas tarjetas no son texto plano así que no se pueden seleccionar y copiar como el resto de la respuesta. Acá van los links en texto simple:

Red neuronal artificial (Wikipedia) https://es.wikipedia.org/wiki/Red_neuronal_artificial

Redes neuronales: Funciones de activación (Google Developers) https://developers.google.com/machine-learning/crash-course/neural-networks/activation-functions?hl=es-419

Red neuronal convolucional (Wikipedia) https://es.wikipedia.org/wiki/Red_neuronal_convolucional

Ahora sí deberías poder copiarlos directo.

Confirmado. Acá las mismas páginas en inglés:

Artificial neural network (Wikipedia) https://en.wikipedia.org/wiki/Artificial_neural_network

Neural networks: Activation functions (Google Developers) https://developers.google.com/machine-learning/crash-course/neural-networks/activation-functions

Convolutional neural network (Wikipedia) https://en.wikipedia.org/wiki/Convolutional_neural_network

https://www.youtube.com/watch?v=sDHcTJzbzos

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0001_thumb.jpg

Jim Keller no es un teórico de la IA; es un tipo que diseña silicio para ganar dinero. Esa perspectiva de ingeniero brutal es lo que hace que su charla valga la pena: no te vende magia, te dibuja números en una pizarra y te obliga a mirar lo obvio. La primera imagen que capturaste es exactamente eso: una ecuación infantil, A = B·C + D, anotada al lado de 10^18. Esa es toda la IA moderna. No importa cuánto hablen de “razonamiento” o “consciencia”; al final, el transformer que escribe tu poesía o conduce tu coche está haciendo multiplicación de matrices a una velocidad que solo un hardware masivo puede sostener. Keller dibuja dos matrices, una de activaciones y otra de pesos, las multiplica, suma un sesgo, y repite esto cientos de veces en capas. La gracia está en la asimetría: si tus matrices son de tamaño n, necesitas n³ operaciones para procesar solo n² datos. Esa intensidad computacional —mucho cálculo sobre poca información— es precisamente por qué las GPUs y los chips como los que diseña Tenstorrent tienen sentido. El cerebro, según Keller, funciona en el mismo régimen.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0002_thumb.jpg

Lo que convierte esos números en algo que parece inteligente es el embedding. En las imágenes del pizarrón se ve cómo toma frases del inglés y las traduce a vectores. El ejemplo que anota es limpio: “I see a dog” más “The dog is brown” resulta en “I see a brown dog”. En el espacio del lenguaje natural eso es absurdo; no podés sumar oraciones. Pero en el espacio vectorial de un modelo entrenado, las palabras dejan de ser símbolos y se convierten en coordenadas. Ahí el significado se vuelve geometría: la distancia entre vectores es semántica, la suma es composición, y la dirección es relación. Tu cerebro no hace álgebra lineal consciente, pero la idea de que la información se codifique en patrones de activación distribuidos —donde el concepto “perro” no vive en una sola neurona sino en un patrón de miles— es exactamente cómo funciona la memoria y el lenguaje en la corteza. Keller usa esto para tender un puente: la IA no es una metáfora del cerebro, es una implementación diferente de los mismos principios matemáticos.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0003_thumb.jpg

La columna derecha del pizarrón, visible en tus capturas 3, 5 y 6, es donde Keller pone los números del cerebro humano con la frialdad de un arquitecto de chips. Diez mil millones de neuronas, un millón de columnas corticales, cada neurona con unas cien mil conexiones. Multiplicando neuronas por frecuencia de disparo por conexiones, llega a 10^18 operaciones por segundo. Ese número, que anota arriba como “1 HOPS” (Human Operations Per Second), es el mismo orden de magnitud que le pide a sus ingenieros para los clusters de IA. Y los parámetros —las sinapsis, los pesos— los estima en cien billones (10^14). Su punto es casi ofensivo para un neurocientífico: eso no es un número radicalmente grande hoy. Son un par de discos duros. Construir el equivalente computacional a un cerebro humano, dice, cuesta hoy unos diez millones de dólares, y esa cifra caerá dos órdenes de magnitud en pocos años. No está hablando de filosofía; está hablando de presupuesto.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0004_thumb.jpg

Con ese marco numérico, ataca los dos mitos que la gente repite en internet y que él tacha en la pizarra: “LLM are Limited” y “We don’t have enough Data”. El primer mito dice que los modelos de lenguaje son tontos porque su operación básica —multiplicar matrices— es demasiado simple. Keller responde que el disparo de una neurona también es simple: es una suma ponderada seguida de una no-linealidad. La simplicidad del componente no limita la complejidad del sistema; de hecho, la uniformidad es una ventaja. Tu corteza cerebral es asombrosamente repetitiva, casi aburrida en su arquitectura, y de ahí surge la flexibilidad. El segundo mito —la escasez de datos— es el que más le divierte. En la parte inferior derecha del pizarrón hace un cálculo tipo Fermi sobre un humano de veinte años: setenta y tres mil horas despierto, entre uno y diez millones de imágenes realmente relevantes vistas, diez a cien millones de horas de video crudo que entran por los ojos, y —lo más sorprendente— apenas unas quinientas mil palabras producidas en toda su vida. Comparado con los billones de tokens que devoran los LLM modernos, un humano entrena con una cantidad trivial de datos. Y remata con el ejemplo de las personas ciegas de nacimiento: no ven nada de ese video, no procesan esas imágenes, y sin embargo alcanzan inteligencia plena. El ojo no es un prerrequisito; la cantidad de datos tampoco.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0005_thumb.jpg

El dibujo de la cadena de cajas en la imagen 5 y 6 representa cómo se entrena una IA hoy: le das “Veo un [blanco]”, la red adivina, comparás con la respuesta correcta, y propagás el error hacia atrás ajustando los pesos. Eso es el backpropagation, la técnica que revolucionó el campo. Keller deja en el aire una pregunta incómoda: sabemos hacer eso en silicio, pero no sabemos cómo lo hace el cerebro. El forward pass —la neurona que recibe señales y dispara— es análogo; el backward pass —cómo se actualizan las sinapsis— sigue siendo un misterio. Su hipótesis, casi en broma pero no del todo, es que el sueño cumple esa función: durante la noche el cerebro reorganiza lo vivido, “hornea” los pesos de largo plazo, consolida lo que importa y descarta el ruido. Es una backpropagation biológica, pero nadie sabe exactamente el algoritmo.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0006_thumb.jpg

La parte más filosófica del pizarrón aparece en la fórmula final, visible en las últimas capturas: la IA moderna es Computación más Datos más Parámetros, mientras que el humano es Inteligencia Computacional más Experimentos. La palabra clave es “experimentos”. Un humano no aprende solo mirando; tira un objeto para ver si cae, toca el fuego para ver si quema, dice una mentira para ver si le creen. Cada experimento genera una sorpresa, y la sorpresa es información densísima. Keller dibuja una curva de error y anota que cuanto más profundo en tu jerarquía de creencias está el error que descubrís, mayor es el impacto en tus “pesos” internos. Equivocarte en un cálculo de propina es trivial; descubrir que la Tierra es plana cuando creías que era redonda requiere reescribir casi todo tu modelo del mundo. Esa es la verdadera eficiencia del cerebro: no necesita petabytes de datos porque genera sus propios datos mediante la acción. Un LLM, sentado pasivamente frente a texto, nunca hará eso a menos que alguien le cierre el bucle con herramientas o un cuerpo.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0007_thumb.jpg

La conclusión que anota al final, tachando los dos mitos, es que la IA no está limitada por su arquitectura ni por la falta de datos en el sentido absoluto; está limitada por nuestra ingeniería actual, y eso cambia rápido. La predicción final, escrita casi como una nota al margen, es que la IA se va a acelerar de forma brutal. La razón es mecánica y casi injusta: enseñarle algo nuevo a un millón de modelos es copiar un archivo de pesos. No podés hacer eso con humanos. Esa asimetría de escalabilidad significa que, una vez que un sistema aprenda algo difícil —manejar, programar, razonar sobre física— todo el planeta lo tendrá instantáneamente. Tu cerebro, en cambio, sigue siendo un hardware de un solo usuario, lento de entrenar, incapaz de descargar actualizaciones. La pregunta que deja Keller flotando en el aire no es si la IA te alcanzará, sino si vos, con tu cerebro biológico de veinte años y quinientas mil palabras, podés competir con algo que acaba de nacer y ya piensa a dieciocho órdenes de magnitud por segundo.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0008_thumb.jpg

Charla de Jim Keller: IA vs. Cerebro Humano

Contexto rápido: Jim Keller es un arquitecto de computadoras muy conocido (trabajó en AMD, Tesla, Intel) y hoy es CEO de Tenstorrent, una empresa que construye chips para IA. En esta charla informal (parece una sobremesa con físicos e ingenieros) explica, desde su perspectiva de “constructor de hardware” y no de “escritor de software de IA”, por qué cree que el cerebro y las IA modernas se parecen mucho más de lo que la gente cree.

1. Lo básico: la IA es “solo” multiplicación de matrices

Keller empieza diciendo algo provocador: en el fondo, todo el software de IA se reduce a repetir una misma operación matemática 10^18 veces — la multiplicación de matrices.En la pizarra (ver imágenes 3 a 6) dibuja exactamente esto: toma una matriz A (con filas) y una matriz W (con columnas), las multiplica, y el resultado es una nueva matriz. La regla es simple: cada elemento del resultado sale de tomar una fila de A, multiplicarla elemento por elemento con una columna de W, y sumar todo. Anota que esto cuesta n³ operaciones sobre n² datos — es decir, con relativamente poca información (n²) generás muchísimo cálculo (n³). Esa desproporción es, según él, la razón por la que las computadoras de IA “funcionan tan bien”: son máquinas hechas para explotar justo ese tipo de intensidad computacional.

En la jerga de IA, a una de esas matrices la llaman “weights” (pesos) — lo que la red aprendió — y a la otra “activaciones” — los datos que están pasando por la red en ese momento. Después de la multiplicación se aplica una función de activación (sigmoide, etc.) que decide “qué tan fuerte” se dispara la siguiente capa, y en los modelos modernos esto se repite cientos de capas, no una sola vez.

2. Embeddings: cómo un texto se convierte en matemática

Esto es lo que se ve en las imágenes 1 y 2. Keller da un ejemplo hermoso de por qué esto es sorprendente: en inglés normal, no podés “sumar” dos oraciones como texto. Pero si conviertes las palabras en vectores (embeddings) dentro de un modelo entrenado, literalmente podés sumar:

  • “I see a dog” (Veo un perro)
  • + “The dog is brown” (El perro es marrón)
  • = “I see a brown dog” (Veo un perro marrón)

Y también podés hacer preguntas tipo consulta: “¿de qué color era el perro?” → “marrón”. Es la idea de que el lenguaje, una vez embebido en ese espacio matemático, se vuelve manipulable como si fueran números.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0009_thumb.jpg

3. El cerebro humano, en los mismos términos

Acá viene la parte fuerte de la charla (imágenes 8 y 14, columna derecha del pizarrón). Keller intenta traducir el cerebro a las mismas unidades que usa para diseñar chips:

  • El cerebro humano tiene ~10 mil millones (10^10) de neuronas, organizadas en ~10^6 “columnas corticales” uniformes (esto es lo notable: la corteza cerebral es asombrosamente uniforme, a diferencia de las regiones más antiguas del cerebro).
  • Cada neurona tiene del orden de 10^5 conexiones (dendritas/axones).
  • Haciendo la cuenta (neuronas × frecuencia de disparo × conexiones), llega a que el cerebro hace algo así como 10^18 operaciones por segundo — el mismo orden de magnitud que anotó arriba para la IA.
  • Estima que el cerebro tiene del orden de 100 billones de parámetros (sinapsis/pesos), lo cual —dice— “no es un número radicalmente grande hoy en día”, es del orden de un par de discos duros.

Con esos números, cuenta que está construyendo literalmente una computadora con esa capacidad: un “1 HOPS” (Human Operations Per Second), y que hoy construir el equivalente a un cerebro humano en cómputo cuesta del orden de $10 millones, cifra que espera bajar 100 veces en pocos años.

4. Los dos mitos que “derrumba”

Con ese marco arma su argumento central. Dice que hay dos frases muy comunes en internet:

  1. “Los LLM son limitados” (porque la operación que hacen es “demasiado simple”)
  2. “No tenemos suficientes datos”

Su respuesta al primero: sí, la operación básica es simple —tan simple como el disparo de una neurona—, pero eso no es una limitación, es justamente lo que hace al cerebro humano capaz de ser inteligente. La simplicidad del componente no implica simplicidad del sistema.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0010_thumb.jpg

5. Cómo se entrena hoy una IA (y por qué el cerebro es distinto)

Esto está en la imagen 9: dibuja una cadena de cajas (bloques con pesos + activaciones) y explica el método de entrenamiento actual, apodado “adivina el espacio en blanco” (guess the blank):

  • Se le da al modelo “Veo un [blanco]” y tiene que predecir la palabra faltante.
  • Al principio los pesos son puro ruido.
  • Se compara la predicción con la respuesta correcta, se calcula la diferencia (el error), y ese error se propaga hacia atrás por la red ajustando los pesos poco a poco — esto es el famoso gradient descent / backpropagation (la técnica que popularizó Geoffrey Hinton).

Un punto clave que remarca: sabemos entrenar redes así, pero no sabemos exactamente cómo se entrena un cerebro humano. El “forward pass” (cómo una neurona dispara y pasa información) se parece mucho a la IA; el “backward pass” (cómo se ajustan los pesos) es un misterio. Su hipótesis: quizás el sueño cumple ese rol, reorganizando información y “horneándola” en los pesos de largo plazo.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0011_thumb.jpg

6. Cuántos datos “ve” realmente un humano en 20 años

Esta es la parte más contraintuitiva (imágenes 10 y 11, columna derecha con “Humans are Comp Int + Experiments”). Hace un cálculo tipo Fermi:

  • 20 años de entrenamiento = ~73.000 horas despierto
  • Entre 1 y 10 millones de imágenes “interesantes” vistas
  • Entre 10 y 100 millones de horas de video (todo lo que entra por los ojos, del cual se puede extraer física, movimiento, causalidad)
  • Hablamos a ~150 palabras/minuto, unas 4 horas al día, la mitad del tiempo hablando nosotros → en 20 años, solo ~500.000 palabras producidas

Su conclusión: comparado con lo que necesita hoy un modelo de IA (billones de palabras de texto), un humano usa una cantidad trivial de datos. Y remata con un argumento fuerte: las personas ciegas de nacimiento también logran inteligencia plena — lo cual demuestra que ni siquiera hacen falta todas esas imágenes/videos para “ser inteligente”. Cuenta la anécdota de sus dos hijas: a una la entrenó como si fuera una IA (mirando cientos de horas de video de manejo) y a la otra le dio 20 reglas y media hora de práctica — ambas aprendieron a manejar bien.

https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0012_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0013_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0014_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0015_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0016_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0017_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0018_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0019_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0020_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0021_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0022_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0023_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0024_thumb.jpg https://archive.org/download/2026-08-13-jimkquiet-images/mpv-shot0025_thumb.jpg

7. La fórmula final (imágenes 10, 11, 12, 13)

Escribe algo así como:

IA moderna = Computación + Datos + Parámetros → Inteligencia Humanos = Inteligentes computacionalmente + Experimentos

La diferencia clave que agrega para los humanos es la palabra “experimentos”: no solo absorbemos datos pasivamente, sino que constantemente probamos cosas activamente en el mundo (deja caer un objeto para ver si cae — “¿esto va a caer?” — y ese único experimento le da mucha información con muy poco dato bruto). También habla del rol de la sorpresa: cuanto más “profundo” en tu árbol de creencias tenés que revisar algo cuando te equivocás, más grande es el impacto de esa sorpresa en tus pesos (el ejemplo es fuerte: descubrir que “la Tierra es plana” te obligaría a invalidar casi todo lo que creés, mientras que un error de cálculo chico es fácil de corregir).

8. Conclusión de Keller

Al final tacha los dos mitos (“LLM Limit” y “Data Limit” — visible en la imagen 12) y concluye:

  • Falsificado: los LLM no están limitados por su estructura computacional (se parece demasiado a cómo funciona una neurona).
  • Falsificado: no hace falta una cantidad descomunal de datos para llegar a inteligencia (los humanos son la prueba).
  • Predicción: la IA se va a acelerar, entre otras cosas porque enseñarle algo nuevo a un millón de IAs es tan fácil como copiar los pesos — algo que no podés hacer con humanos.

Si querés, puedo profundizar en alguna parte específica —por ejemplo la comparación neurona-vs-transistor, la parte de “mixture of experts”, o la analogía entre sorpresa/backprop y cómo funciona tu propio aprendizaje— ya que dijiste que tu interés es entender tu propio cerebro a través de esto.