Sylfaen

A Equação do Significado

A IA atual utiliza a força bruta para processar o significado. O que mudará quando aprendermos como o significado realmente funciona?

A Equação do Significado
A Equação do Significado DJ Yoes

Sempre que conversa com uma IA, está a falar com uma das máquinas mais caras alguma vez construídas, e nem o utilizador nem os seus criadores conseguem explicar totalmente como ela faz o que faz. A inteligência artificial continua a tornar-se mais capaz, mas apenas à custa de se tornar dramaticamente mais cara. Cada grande salto no desempenho exigiu mais dados, mais parâmetros, hardware mais especializado e mais energia. O padrão é familiar: modelos maiores, treinados com mais texto, por períodos mais longos, a um custo mais elevado.

A abordagem tem funcionado excecionalmente bem. Contudo, também criou um problema silencioso. A eficiência continua a melhorar e a capacidade de ontem torna-se mais barata a cada ano que passa. Mas a fronteira é diferente. Cada novo incremento de capacidade na linha da frente custa mais do que o anterior, e nada no paradigma sugere que isso mude por si só.

Existe outro caminho.

Se compreendêssemos melhor como o próprio significado funciona, poderíamos representá-lo diretamente em vez de o aproximarmos através de uma escala cada vez maior. Essa possibilidade altera a economia da inteligência.

Dentro da Caixa Negra

Os seres humanos utilizam o significado todos os dias sem saberem como o fazem realmente. Compreendemos o sarcasmo, a implicação e o contexto instantaneamente, mas não conseguimos explicar a mecânica interna.

A IA enfrenta o mesmo problema pelo lado oposto. Transforma cada palavra numa longa lista de números e aprende a prever a palavra seguinte estudando milhares de milhões de frases. Através de quantidades massivas de dados de treino, torna-se extremamente eficaz a prever o que vem a seguir. Se isso conta como compreensão, é um debate que deixarei de lado. O ponto mais simples é que ninguém consegue abrir o modelo e apontar para onde reside o significado ou como ele funciona.

Tanto os humanos como a IA atual utilizam o significado sem compreenderem verdadeiramente como ele funciona.

Há, porém, uma diferença reveladora. Quando os investigadores abrem os modelos de IA, continuam a encontrar indícios de geometria no seu interior: conceitos que se comportam como direções, significados que se somam e subtraem. A estrutura do significado parece estar lá dentro. Os modelos apenas tiveram de a redescobrir do zero, com custos enormes, porque ninguém a escreveu.

Palavras são significado em repouso. Frases são significado em movimento. O significado é composto, não meramente recuperado: as palavras marcam coordenadas no espaço semântico e as frases traçam caminhos através dele, com cada palavra a reformular o contexto das outras.

O Significado Não Precisa de se Tornar Transparente

A ideia de que o significado poderá eventualmente ser expresso matematicamente é fácil de interpretar mal.

Não exige que cada pensamento, sentimento ou interpretação se torne totalmente explicável. O significado pode nunca vir a ser completamente transparente. A consciência, a história pessoal, o contexto cultural e a experiência subjetiva continuarão, provavelmente, a introduzir elementos que resistem a uma formalização total.

Mas o significado não precisa de se tornar transparente para ser útil. Precisa apenas de se tornar translúcido: compreendido o suficiente para podermos identificar os padrões mais profundos e estáveis que formam a base do significado. Embora a linguagem em si seja frequentemente confusa e ambígua à superfície, estes padrões fundamentais permanecem consistentes em diversos contextos.

Já aceitamos este tipo de formalização parcial noutros domínios. Não precisamos de uma explicação filosófica completa da vida para construir modelos genéticos úteis. Não precisamos de compreender totalmente a consciência para prever como certos químicos afetam o cérebro. Não precisamos de modelos meteorológicos perfeitos para produzir previsões que sejam precisas o suficiente para terem valor.

Um quadro matemático não precisaria de captar todas as nuances. Precisaria apenas de captar estrutura suficiente para que parte da atual dependência da aproximação por força bruta se tornasse desnecessária.

A Taxa da Força Bruta

Os sistemas de IA atuais dependem fortemente da escala. Exigem conjuntos de dados enormes e grandes números de parâmetros em parte porque carecem de um quadro explícito para o modo como as relações semânticas funcionam.

Sem esse quadro, o modelo deve inferir padrões relacionados através de um vasto número de exemplos. Encontra variações da mesma ideia subjacente em diferentes contextos e constrói gradualmente uma representação interna através da repetição e da associação estatística.

Isto é caro.

Muito do que o modelo aprende poderia, em princípio, ser derivado de um conjunto menor de relações fundamentais se essas relações fossem já conhecidas. Em vez disso, o sistema deve redescobri-las indiretamente através do volume.

Uma abordagem matemática ao significado não eliminaria a necessidade de representações aprendidas. Iria organizá-las e restringi-las. O modelo ainda precisaria de aprender sobre o mundo, mas já não precisaria de reaprender padrões básicos de como o significado se transforma entre contextos na mesma escala.

Parte do que é atualmente armazenado como parâmetros poderia ser substituído por regras e transformações mais compactas.

Esta é a taxa da força bruta: a escala extra necessária porque nos falta uma forma mais direta de representar o que é o significado e como ele muda.

A Objeção Óbvia

Qualquer pessoa que acompanhe a IA há algum tempo reconhecerá esta ideia e também se lembrará do que lhe aconteceu. Durante décadas, os investigadores tentaram construir conhecimento nas máquinas manualmente: sistemas especialistas, coleções de regras, ontologias gigantes feitas à mão. A escala derrotou-os a todos. A lição foi tão consistente que ganhou um nome, a Lição Amarga: métodos genéricos somados a mais computação vencem, e o conhecimento humano incorporado perde.

Mas olhemos com atenção para o que realmente perdeu. O que morreu foi o conteúdo codificado à mão, humanos a dactilografar factos e regras nas máquinas. O que continuou a vencer foi a estrutura derivada da matemática. A convolução é o exemplo mais famoso: alguém escreveu o simples facto de que um objeto continua a ser o mesmo objeto quando se desloca numa imagem, e a visão computacional tornou-se drasticamente mais barata quase da noite para o dia. O mecanismo de atenção, no interior dos modelos atuais, é outro. Em cada caso, uma afirmação compacta sobre a estrutura de um domínio substituiu uma quantidade enorme de aprendizagem que a máquina deixou de ter de fazer.

Um quadro matemático para o significado pertence à segunda categoria, não à primeira. Não é um livro de regras de factos sobre o mundo. É uma afirmação sobre como o próprio significado é moldado, o mesmo tipo de movimento que tornou a visão barata.

Uma equação de significado não substituiria as redes neuronais. Forneceria o viés indutivo que as poderia tornar muito mais eficientes no que fazem melhor: navegar na geometria em vez de memorizar coordenadas.

Comprimir o Significado, Não Apenas os Dados

A compressão tradicional remove o excesso de dados. Uma imagem comprimida não armazena cada píxel de forma independente. Identifica padrões e armazena a informação necessária para os reconstruir. O mesmo princípio aplica-se ao vídeo, áudio e texto.

Uma compreensão matemática do significado permitiria uma forma de compressão mais profunda: a compressão semântica. Em vez de comprimir a forma superficial da linguagem, comprimiria a estrutura subjacente do que a linguagem está a tentar transmitir.

Duas passagens que utilizam palavras inteiramente diferentes podem exprimir quase a mesma ideia. Hoje, armazenamos ambas como sequências separadas de tokens. Um sistema semântico poderia reconhecer que as estruturas subjacentes estão estreitamente relacionadas e representá-las de forma mais eficiente. Uma explicação longa poderia ser reduzida a um conjunto compacto de relações, pressupostos, níveis de confiança e dependências contextuais, a partir dos quais uma IA poderia mais tarde reconstruir versões apropriadas para diferentes públicos.

Este é o mecanismo que poderia tornar os sistemas de IA do futuro drasticamente mais pequenos. A redução não viria de tornar os modelos mais burros. Viria da remoção da redundância que existe atualmente porque carecemos de uma representação melhor do próprio significado.

O Que a IA se Poderia Tornar Pós-Escala

Se o significado se tornar parcialmente formalizável, a arquitetura da IA poderá mudar.

Em vez de depender primariamente de modelos monolíticos cada vez maiores, os sistemas futuros poderiam combinar um quadro semântico universal mais pequeno com componentes especializados mais leves. A parte universal lidaria com as relações estruturais que os modelos atuais têm de aproximar repetidamente. As partes especializadas lidariam com o conhecimento do domínio, a variação cultural e o contexto em tempo real.

O resultado não seria um sistema puramente simbólico a substituir as redes neuronais. Seria mais provavelmente um híbrido no qual as representações aprendidas são organizadas e comprimidas por uma teoria matemática do significado mais profunda. A inteligência tornar-se-ia mais compressível do que o atual paradigma de escala pressupõe.

Isto não significa que a IA se tornaria subitamente trivial ou que todos os problemas seriam resolvidos. Significa que o custo marginal da capacidade adicional poderia cair significativamente assim que parássemos de pagar a taxa total da força bruta sobre o significado.

Para Além do Conhecimento

Comprimir o conhecimento é uma coisa.

Mas assim que o próprio significado se torne matematicamente tratável, poderemos ser capazes de comprimir algo muito mais complicado do que factos ou linguagem: os padrões recorrentes da mente de um indivíduo.

Essa possibilidade altera o que a inteligência pode vir a ser.

Peças deste puzzle já estão a ser exploradas, algumas dentro de grandes laboratórios e outras por investigadores independentes que trabalham abertamente. O cronograma é incerto, mas a direção não o é. Mais cedo ou mais tarde, alguém tornará o significado matematicamente utilizável.

A única questão real é quem lá chegará primeiro e o que escolheremos construir com isso.

Subscreve "Sylfaen" para receber atualizações diretamente na tua caixa de entrada
DJ Yoes

Subscreve DJ Yoes para reagir

Subscrever

Comentários

Ainda não há comentários. Sê o primeiro a comentar!

Subscreve Sylfaen para receber atualizações diretamente na tua caixa de entrada