O Ponto Fraco Oculto da IA: Por Que Modelos de Bilhões de Dólares Falham Num Teste Que Qualquer Criança Passa
GPT-4o: de 91% com 5 palavras para 15% com 40. Em condições mistas: 1%. GPT-5, Claude Opus 4.1 e Gemini 2.5 também falharam. Um paper do PNAS Nexus provou: transformers não têm 'árbitro' para resolver conflitos de atenção. É limitação arquitetural.