Sylfaen

La ecuación del significado

La IA actual recurre a la fuerza bruta para procesar el significado. ¿Qué cambiará cuando aprendamos cómo funciona realmente el significado?

La ecuación del significado
La ecuación del significado DJ Yoes

Cada vez que chateas con una IA, estás hablando con una de las máquinas más caras jamás construidas y ni tú ni sus creadores podéis explicar del todo cómo hace lo que hace. La inteligencia artificial no deja de ganar capacidades, pero solo a base de volverse drásticamente más costosa. Cada gran salto en el rendimiento ha requerido más datos, más parámetros, hardware más especializado y más energía. El patrón es familiar: modelos más grandes, entrenados con más texto, durante periodos más largos y a un coste mayor.

Este enfoque ha funcionado notablemente bien, pero también ha generado un problema silencioso. La eficiencia sigue mejorando y la capacidad de ayer es cada año más barata. Sin embargo, la vanguardia es otra historia. Cada nuevo incremento de capacidad en el límite del progreso cuesta más que el anterior, y nada en el paradigma actual sugiere que esto vaya a cambiar por sí solo.

Existe otro camino.

Si comprendiéramos mejor cómo funciona el significado en sí, podríamos representarlo directamente en lugar de aproximarnos a él mediante una escala cada vez mayor. Esa posibilidad cambia la economía de la inteligencia.

Dentro de la caja negra

Los seres humanos utilizamos el significado a diario sin saber realmente cómo lo hacemos. Entendemos el sarcasmo, las implicaciones y el contexto de forma instantánea, pero no podemos explicar su mecánica interna.

La IA se enfrenta al mismo problema desde el otro lado. Convierte cada palabra en una larga lista de números y aprende a predecir la siguiente palabra estudiando miles de millones de frases. A través de cantidades masivas de datos de entrenamiento, se vuelve extremadamente hábil prediciendo qué viene después. No entraré en el debate de si eso cuenta como comprensión. El punto más sencillo es que nadie puede abrir el modelo y señalar dónde reside el significado o cómo funciona.

Tanto los humanos como la IA actual utilizan el significado sin entender verdaderamente su funcionamiento.

Sin embargo, hay una diferencia reveladora. Cuando los investigadores analizan las entrañas de los modelos de IA, no dejan de encontrar indicios de geometría: conceptos que se comportan como direcciones, significados que se suman y se restan. La estructura del significado parece estar ahí dentro. Los modelos simplemente han tenido que redescubrirla desde cero, con un coste enorme, porque nadie la ha formulado explícitamente.

Las palabras son el significado en reposo. Las frases son el significado en movimiento. El significado se compone, no solo se recupera: las palabras marcan coordenadas en el espacio semántico y las frases trazan caminos a través de él, donde cada palabra redefine el contexto de las demás.

El significado no necesita volverse transparente

La idea de que el significado pueda acabar expresándose matemáticamente es fácil de malinterpretar.

No requiere que cada pensamiento, sentimiento o interpretación sea totalmente explicable. Es posible que el significado nunca llegue a ser completamente transparente. La conciencia, la historia personal, el contexto cultural y la experiencia subjetiva probablemente seguirán introduciendo elementos que se resisten a una formalización completa.

Pero el significado no necesita ser transparente para ser útil. Solo necesita ser traslúcido: lo suficientemente comprendido como para que podamos identificar los patrones más profundos y estables sobre los que se asienta. Aunque el lenguaje suele ser confuso y ambiguo en la superficie, estos patrones fundacionales se mantienen constantes en distintos contextos.

Ya aceptamos este tipo de formalización parcial en otros campos. No necesitamos un tratado filosófico completo sobre la vida para construir modelos genéticos útiles. No necesitamos entender la conciencia en su totalidad para predecir cómo afectan ciertos químicos al cerebro. No necesitamos modelos meteorológicos perfectos para generar pronósticos lo bastante precisos como para ser valiosos.

Un marco matemático no tendría que capturar cada matiz. Solo tendría que capturar la estructura suficiente para que parte de la actual dependencia de la aproximación por fuerza bruta resulte innecesaria.

El impuesto de la fuerza bruta

Los sistemas de IA actuales dependen enormemente de la escala. Requieren conjuntos de datos gigantescos y una enorme cantidad de parámetros, en parte porque carecen de un marco explícito de cómo funcionan las relaciones semánticas.

Sin ese marco, el modelo debe inferir patrones relacionados a partir de una ingente cantidad de ejemplos. Encuentra variaciones de la misma idea subyacente en diferentes contextos y construye gradualmente una representación interna mediante la repetición y la asociación estadística.

Esto es caro.

Gran parte de lo que el modelo aprende podría, en principio, derivarse de un conjunto más pequeño de relaciones fundacionales si estas ya fueran conocidas. En su lugar, el sistema debe redescubrirlas indirectamente a través del volumen.

Un enfoque matemático del significado no eliminaría la necesidad de representaciones aprendidas, sino que las organizaría y limitaría. El modelo seguiría necesitando aprender sobre el mundo, pero ya no tendría que reaprender patrones básicos de cómo se transforma el significado entre contextos a la escala actual.

Parte de lo que hoy se almacena como parámetros podría sustituirse por reglas y transformaciones más compactas.

Este es el impuesto de la fuerza bruta: la escala extra necesaria por carecer de una forma más directa de representar qué es el significado y cómo varía.

La objeción obvia

Cualquiera que haya seguido la IA durante un tiempo reconocerá esta idea y también recordará qué fue de ella. Durante décadas, los investigadores intentaron introducir el conocimiento en las máquinas a mano: sistemas expertos, colecciones de reglas, ontologías gigantes creadas artesanalmente. La escala los venció a todos. La lección fue tan constante que se le dio un nombre, la Lección Amarga: los métodos generales sumados a más computación ganan, y el conocimiento humano incorporado pierde.

Pero observemos de cerca qué fue lo que perdió realmente. Lo que murió fue el contenido codificado a mano, los humanos tecleando hechos y reglas en las máquinas. Lo que siguió ganando fue la estructura derivada de las matemáticas. La convolución es el ejemplo famoso: alguien formuló el simple hecho de que un objeto sigue siendo el mismo objeto aunque se mueva por una imagen, y la visión por computador se volvió drásticamente más barata casi de la noche a la mañana. La atención, el mecanismo central de los modelos actuales, es otro. En cada caso, una declaración compacta sobre la estructura de un dominio sustituyó a una cantidad enorme de aprendizaje que la máquina ya no tuvo que realizar.

Un marco matemático para el significado pertenece a la segunda categoría, no a la primera. No es un manual de reglas sobre hechos del mundo. Es una declaración sobre cómo se configura el propio significado, el mismo tipo de movimiento que abarató la visión artificial.

Una ecuación del significado no reemplazaría a las redes neuronales. Proporcionaría el sesgo inductivo que podría hacerlas mucho más eficientes en lo que mejor saben hacer: navegar por la geometría en lugar de memorizar coordenadas.

Comprimir el significado, no solo los datos

La compresión tradicional elimina la redundancia de los datos. Una imagen comprimida no almacena cada píxel de forma independiente; identifica patrones y guarda la información necesaria para reconstruirlos. El mismo principio se aplica al vídeo, al audio y al texto.

Una comprensión matemática del significado permitiría una forma más profunda de compresión: la compresión semántica. En lugar de comprimir la forma superficial del lenguaje, comprimiría la estructura subyacente de lo que el lenguaje intenta transmitir.

Dos pasajes que utilizan una redacción totalmente distinta pueden expresar casi la misma idea. Hoy los almacenamos como secuencias de tokens separadas. Un sistema semántico podría reconocer que las estructuras subyacente están estrechamente relacionadas y representarlas de forma más eficiente. Una explicación larga podría reducirse a un conjunto compacto de relaciones, asunciones, niveles de confianza y dependencias contextuales a partir de las cuales una IA podría reconstruir más tarde versiones adecuadas para diferentes audiencias.

Este es el mecanismo que podría hacer que los futuros sistemas de IA sean drásticamente más pequeños. La reducción no vendría de hacer los modelos más tontos, sino de eliminar la redundancia que existe actualmente por carecer de una representación mejor del significado mismo.

Lo que la IA podría llegar a ser tras la escala

Si el significado se vuelve parcialmente formalizable, la arquitectura de la IA podría cambiar.

En lugar de depender principalmente de modelos monolíticos cada vez más grandes, los sistemas futuros podrían combinar un marco semántico universal más pequeño con componentes especializados más ligeros. La parte universal gestionaría las relaciones estructurales que los modelos actuales deben aproximar repetidamente. Las partes especializadas se encargarían del conocimiento del dominio, la variación cultural y el contexto en tiempo real.

El resultado no sería un sistema puramente simbólico que sustituyera a las redes neuronales. Lo más probable sería un híbrido en el que las representaciones aprendidas estuvieran organizadas y comprimidas por una teoría matemática profunda del significado. La inteligencia se volvería más compresible de lo que asume el paradigma de escala actual.

Esto no significa que la IA se vuelva trivial de repente o que todos los problemas se solucionen. Significa que el coste marginal de la capacidad adicional podría caer significativamente una vez que dejemos de pagar el impuesto total de la fuerza bruta sobre el significado.

Más allá del conocimiento

Comprimir el conocimiento es una cosa.

Pero una vez que el significado mismo sea matemáticamente manejable, podríamos ser capaces de comprimir algo mucho más complejo que los hechos o el lenguaje: los patrones recurrentes de una mente humana individual.

Esa posibilidad cambia lo que la inteligencia puede llegar a ser.

Ya se están explorando piezas de este rompecabezas, algunas dentro de grandes laboratorios y otras por investigadores independientes que trabajan en abierto. El plazo es incierto, pero la dirección no lo es. Tarde o temprano, alguien hará que los significados sean matemáticamente utilizables.

La única pregunta real es quién llegará primero y qué decidiremos construir con ello.

Suscríbete a "Sylfaen" para recibir actualizaciones directamente en tu correo
DJ Yoes

Suscríbete a DJ Yoes para reaccionar

Suscribirse

Comentarios

Aún no hay comentarios. ¡Sé el primero en comentar!

Suscríbete a Sylfaen para recibir actualizaciones directamente en tu correo