Por qué los LLM necesitan buscar en la web (y por qué eso mantiene vivo el SEO)
Hace cosa de un año, en mi artículo sobre los leaks de GPT-5, recogía unas palabras de Sam Altman en una charla: su modelo ideal sería uno pequeño, con una capacidad de razonamiento superior a la humana, un contexto enorme y acceso a todo tipo de herramientas. La idea de fondo era que ese modelo simplemente saldría a buscar lo que no sabe. Más eficiente, siempre actualizado sin necesidad de reentrenar y, como ya sabemos, buscar fuera reduce las alucinaciones.
He visto exactamente lo mismo cada vez que he analizado filtraciones de system prompts de distintos buscadores. Todos los laboratorios le explican al modelo en qué momento debe salir a buscar, y la razón es siempre la misma: conocimiento fresco y verificable.
El inconveniente es que buscar tiene un coste elevado, y plantar cara a Google es poco menos que una quimera. Cuando me metí a fondo en el juicio antimonopolio contra Google, me encontré con unas declaraciones de Nick Turley, Head of Product de ChatGPT, que lo decían sin rodeos: su objetivo era cubrir con índice propio el 80% de las consultas, y que ese 20% restante les llevaría años. Casi un año después, en mayo, la documentación de ChatGPT confirmaba que ese índice ya existe, algo que pude verificar revisando las llamadas XHR.
Ahora llega un estudio que pone números concretos al problema. En AA-Omniscience, de Artificial Analysis, se lanzaron 6.000 preguntas sobre hechos concretos sin permitir búsqueda externa. El resultado: los 12 mejores modelos actuales fallan entre un 23% y un 43% de las veces. Los dos más capaces, Claude Opus 5.5 y GPT-6 Astra, se equivocan en casi una de cada cuatro respuestas.
Dentro de una misma familia de modelos, el grande comete menos errores que el mediano: Opus 5.5 falla un 23% frente al 29% de Sonnet 5.5. Meter más conocimiento en los pesos requiere más tamaño, y más tamaño cuesta más dinero. Exactamente lo que planteaba el bueno de Sam.
Ahora bien, el estudio tiene algunos matices que conviene tener en cuenta:
Las preguntas están seleccionadas para ser difíciles para los modelos más avanzados. Ese 23% de error no refleja lo que experimenta alguien usando ChatGPT en su día a día. Además, el modelo tiene la opción de responder “no lo sé” —algo cada vez más habitual, aunque no tanto en ChatGPT—, así que lo que queda hasta el 100% no son todo aciertos: la ignorancia real del modelo supera ese porcentaje. Y lo más importante: el estudio mide el modelo sin herramientas, sin decir nada sobre cuándo decide buscar por su cuenta, que es precisamente la otra mitad de la historia y donde entramos los de SEO.
En definitiva, mientras exista un buscador, ya sea tradicional o de inteligencia artificial, habrá un SEO detrás metiéndose donde no le llaman. Larga vida al SEO.
Por qué los LLM necesitan búsqueda web y qué implica para el SEO: estudio con 6.000 preguntas factuales
Resumen técnico
El benchmark AA-Omniscience de Artificial Analysis evalúa 12 modelos top con 6.000 preguntas factuales sin acceso a herramientas. Resultados: tasa de error entre 23% y 43%. Claude Opus 5.5 falla en el 23% de casos; Sonnet 5.5, en el 29%. La diferencia entre ambos demuestra que el conocimiento factual se almacena en los pesos del modelo y escalar ese conocimiento exige mayor tamaño de modelo. ChatGPT ya opera con un índice propio, confirmado en su documentación oficial y verificable mediante inspección de llamadas XHR. El objetivo declarado por Nick Turley es cubrir el 80% de consultas sin depender de índices externos.
Análisis de implicaciones
Los modelos grandes almacenan más conocimiento factual en pesos, pero el coste computacional hace inviable escalar indefinidamente. La búsqueda externa actúa como capa de conocimiento dinámico: reduce alucinaciones, elimina la necesidad de reentrenamiento continuo y mantiene frescura informativa. El problema es que buscar tiene coste por llamada, lo que obliga a los labs a construir índices propios. Donde hay índice, hay ranking. Donde hay ranking, hay optimización. El SEO no desaparece: se desplaza hacia los sistemas de recuperación de los propios LLM.
Aplicación práctica
Los system prompts filtrados de los principales labs incluyen instrucciones explícitas sobre cuándo el modelo debe lanzar una búsqueda externa: el criterio dominante es conocimiento fresco y factual. Esto significa que el contenido actualizado, con datos verificables y fechas explícitas, tiene mayor probabilidad de ser recuperado y citado. Para SEO técnico: priorizar structured data, frescura de contenido, cobertura de entidades factuales y presencia en las fuentes que estos índices rastrean. El índice propio de ChatGPT ya indexa contenido independientemente de Google.
Contexto del sector
Durante el juicio antimonopolio contra Google, Nick Turley declaró que cubrir el 20% restante de consultas con índice propio llevaría años. Ese proceso está en marcha. Los labs convergen hacia arquitecturas de modelo pequeño con razonamiento potente más acceso a herramientas, tal como anticipó Sam Altman. La dependencia de índices externos es un cuello de botella técnico y económico que todos los players están tratando de eliminar. El SEO es la disciplina que opera exactamente en esa capa de recuperación.
Artículo relacionado
Análisis de los leaks de GPT-5 y la visión de Sam Altman sobre modelos con acceso a herramientas · Declaración de Nick Turley en el juicio antimonopolio de Google · Documentación del índice propio de ChatGPT · Gráfica del benchmark AA-Omniscience

