La mayor limitación de un LLM local no es más la alucinación. Es la fecha de corte del entrenamiento. Pregunta a Llama 3.1 sobre una biblioteca que se lanzó seis meses después de su fecha de corte y el modelo inventa con confianza llamadas a API que nunca existieron. La solución es la integración de búsqueda web, y hasta hace poco requería la API de OpenAI. Ahora existen las herramientas para agregar búsqueda en tiempo real a un modelo local, funcionan y mantienen la privacidad.
Probamos siete aplicaciones que dan a un LLM local acceso a la web actual. Algunos son interfaces completas con búsqueda incorporada. Algunos son middleware entre un motor de búsqueda y su punto final de Ollama. A continuación se indica qué hace cada uno, dónde falla y qué combinación funciona mejor para los stack LLM locales comunes.
Qué buscar en una herramienta de búsqueda web para LLM local
La capa de búsqueda web importa más que el modelo detrás de ella. Algunos criterios.
- Fuente de búsqueda. SearXNG (metabúsqueda, privada), API de Bing, API de Brave Search o Google raspado. Algunas herramientas funcionan con todas; algunas lo cierran.
- Chunking y reranking. Los resultados de búsqueda sin procesar confunden a la mayoría de los modelos locales. Las buenas herramientas dividen los resultados principales, los incrustan, los reordenan por relevancia y solo alimentan los fragmentos principales en el prompt.
- Calidad de citación. La respuesta debe indicar de qué URL se extrajo. Los enlaces de cita al estilo de Perplexity son el estándar de oro.
- Compatibilidad con Ollama o llama.cpp. Algunas herramientas asumen la API de OpenAI. La compatibilidad con Ollama ahora es estándar pero verifique.
- Streaming. Esperar a que se completen la búsqueda, la recuperación y la generación antes de mostrar algo arruina la UX. La transmisión debe comenzar en el momento en que los tokens estén listos.
Comparación rápida
| Aplicación | Mejor para | Plataformas | Plan gratuito | Precio inicial/mes | Calificación |
|---|---|---|---|---|---|
| Perplexica | Interfaz al estilo Perplexity | Docker | Totalmente gratis | Gratis | 4.7 |
| SearXNG | Backend de metabúsqueda privada | Docker, Linux | Totalmente gratis | Gratis | 4.6 |
| Open WebUI | Interfaz LLM con plugin web | Docker | Totalmente gratis | Gratis | 4.7 |
| AnythingLLM | RAG + agente de navegación web | Windows, macOS, Linux | Totalmente gratis | Gratis | 4.5 |
| LibreChat | Clon de ChatGPT con plugins de búsqueda | Docker | Totalmente gratis | Gratis | 4.6 |
| LlamaIndex | Canalizaciones conscientes de web de bricolaje | Librería de Python | Totalmente gratis | Gratis | 4.5 |
| Msty | Aplicación de escritorio local-first con chat LLM | Windows, macOS, Linux | Nivel gratuito | Alrededor de $10/mes Pro | 4.4 |
Las aplicaciones
1. Perplexica — Mejor clon de Perplexity para LLM locales
Perplexica reconstruye la UX de Perplexity.ai para modelos locales. Haga una pregunta, busca (a través de SearXNG de forma predeterminada), raspado de las páginas principales, las divide en fragmentos y alimenta pasajes relevantes a su LLM local con un prompt que solicita respuestas citadas.
La respuesta se transmite con citas en línea que se vinculan a las páginas de origen. Funciona con Ollama y cualquier punto final compatible con OpenAI, por lo que llama.cpp con el shim de OpenAI también funciona.
Dónde se queda corta: La configuración requiere Docker más SearXNG ejecutándose lado a lado. El pulido de UI está ligeramente detrás de Perplexity comercial.
Precios:
- Gratis: Open source
- Pagado: Ninguno
Plataformas: Docker (se ejecuta donde sea que Docker se ejecute)
Descargar: Perplexica
Conclusión: La opción predeterminada si desea un reemplazo de Perplexity que se ejecute localmente. La configuración requiere 30 minutos con Docker Compose.
2. SearXNG — Mejor backend de búsqueda privada
SearXNG es un motor de metabúsqueda que consulta Google, Bing, DuckDuckGo, Brave y docenas de otras fuentes y devuelve resultados unificados. Alójelo usted mismo y cada búsqueda desde su stack de LLM local se vuelve anónima para los motores originales.
Cada herramienta anterior (Perplexica, Open WebUI, LibreChat) admite SearXNG como backend de búsqueda. Se sitúa bajo todo el stack.
Dónde se queda corta: SearXNG independiente es una página de búsqueda, no una herramienta de LLM. Necesita una interfaz que consuma sus resultados.
Precios:
- Gratis: Open source
- Pagado: Ninguno
Plataformas: Docker, Python
Descargar: SearXNG
Conclusión: Instálelo una vez y apunte todas las demás herramientas de LLM locales hacia él. Elimina el problema de “qué clave de API necesito”.
3. Open WebUI — Mejor interfaz LLM todo en uno con búsqueda web
Open WebUI envía búsqueda web como plugin. Habilite la herramienta de búsqueda en el panel de administrador, elija SearXNG o una API de pago (Serper, Brave), y cada chat ahora puede activar una búsqueda cuando el modelo lo solicite.
Combinado con RAG de documento de Open WebUI, autenticación por usuario y soporte multimodelo, esto cubre la mayoría de lo que necesita un usuario de LLM local en una interfaz.
Dónde se queda corta: El plugin de búsqueda es opt-in por chat de forma predeterminada, por lo que los usuarios primerizos no lo obtienen automáticamente. Requiere un paso de configuración adicional.
Precios:
- Gratis: Open source
- Pagado: Ninguno
Plataformas: Docker (cualquier host Linux, macOS, Windows)
Descargar: Open WebUI
Conclusión: La mejor opción si ya ejecuta Open WebUI. Agregar búsqueda es un cambio de configuración.
4. AnythingLLM — Mejor para aplicación de escritorio con agentes
AnythingLLM es una aplicación de escritorio independiente (no solo Docker) que se ejecuta en Windows, macOS y Linux. Viene con primitivos de agente y el agente de búsqueda web utiliza SearXNG, Serper o Bing API para obtener páginas actuales.
RAG sobre documentos locales se encuentra en la misma interfaz, por lo que puede mezclar “buscar en la web” con “buscar mi bóveda de Obsidian” en una conversación.
Dónde se queda corta: La aplicación de escritorio es más pesada que una interfaz basada en navegador. Algunos modos de búsqueda requieren una clave de API incluso con el nivel gratuito.
Precios:
- Gratis: Aplicación de escritorio, todas las funciones
- Pagado: Alrededor de $50/mes nivel Cloud para alojado
Plataformas: Windows, macOS, Linux, Docker
Descargar: AnythingLLM
Conclusión: Elija esto si desea una verdadera aplicación de escritorio en lugar de una pestaña localhost. Lo mejor todo en uno para uso personal.
5. LibreChat — Mejor para ChatGPT-style UX con plugins de búsqueda
LibreChat clona la interfaz de ChatGPT y agrega soporte de plugins. La búsqueda web proviene del complemento de navegación web incorporado, que admite backends de Google, Brave y Serper. Apunte el chat a Ollama y obtendrá ChatGPT con acceso web encima de un modelo local.
La arquitectura del plugin significa que las nuevas herramientas (calculadora, ejecución de código, generación de imágenes) se instalan sin cambiar la interfaz.
Dónde se queda corta: La configuración del plugin es más pesada que la de Perplexica u Open WebUI. Requiere editar archivos JSON.
Precios:
- Gratis: Open source
- Pagado: Ninguno
Plataformas: Docker, Node.js
Descargar: LibreChat
Conclusión: La mejor opción si específicamente desea el clon de UI de ChatGPT. El ecosistema de plugins es más amplio que la mayoría de las alternativas.
6. LlamaIndex — Mejor para crear su propia canalización web-aware
LlamaIndex es un framework de Python, no una interfaz. Úsalo cuando quieras una aplicación personalizada: RAG sobre web + PDF + base de datos, bucles de agente, llamadas de herramientas, y todo conectado a través de su punto final Ollama o llama.cpp.
La integración de búsqueda web admite Google, Bing, DuckDuckGo, Serper, Tavily y más. Los primitivos de reranking (BM25, encoders cruzados) van más allá de lo que ofrecen las interfaces pregeneradas.
Dónde se queda corta: Sin interfaz. Usted escribe la aplicación.
Precios:
- Gratis: Open source (MIT)
- Pagado: Ninguno (LlamaCloud administrado existe por separado)
Plataformas: Librería de Python
Descargar: LlamaIndex
Conclusión: Elija esto para cualquier cosa más allá de lo que ofrecen las interfaces pregeneradas. La curva de aprendizaje más pronunciada, el techo más alto.
7. Msty — Mejor aplicación de escritorio local-first con búsqueda incorporada
Msty es una aplicación de escritorio de descarga única que combina UI de chat, gestión de modelos y modo de búsqueda web incorporado. Active “buscar web” en cualquier chat y Msty raspa resultados y los alimenta en su prompt.
El instalador de modelo de un clic para modelos Ollama lo convierte en el punto de partida más fácil para alguien que nunca ha tocado Docker o una terminal.
Dónde se queda corta: El nivel gratuito limita algunas características (divisiones de modelos múltiples, espacios de trabajo). La fuente de búsqueda es patentada.
Precios:
- Gratis: Personal, características principales
- Pagado: Alrededor de $10/mes Pro, $50 de por vida
Plataformas: Windows, macOS, Linux
Descargar: Msty
Conclusión: La mejor opción para un usuario no técnico que desea un LLM local con acceso web y no quiere tocar una terminal.
Cómo elegir el correcto
Si desea la configuración más rápida: Msty. Descargue, instale, active la búsqueda web.
Si desea el reemplazo de Perplexity más cercano: Perplexica + SearXNG. Treinta minutos con Docker Compose.
Si ya ejecuta una interfaz LLM local: habilite la búsqueda web dentro de Open WebUI, LibreChat o AnythingLLM. Más rápido que implementar una segunda herramienta.
Si está creando aplicaciones de IA personalizadas: LlamaIndex. Omita las interfaces por completo.
Si la privacidad es la prioridad: SearXNG en el medio, sin API de terceros. Perplexica u Open WebUI arriba.
FAQ
¿Qué LLM local maneja mejor las respuestas aumentadas por web? Llama 3.1 8B o Qwen 2.5 7B son el mínimo práctico para síntesis coherente de múltiples fuentes. Por debajo de parámetros de 7B, el modelo lucha por conciliar fuentes en conflicto. Por encima de 30B, la calidad mejora marginalmente pero la demanda de hardware crece rápidamente.
¿Necesito una clave de API para la búsqueda web? No. SearXNG más cualquiera de las interfaces anteriores funciona sin cuentas externas. Los backends pagos (Serper, Brave API, Tavily) ofrecen resultados más confiables por consulta y mayor rendimiento.
¿Puedo usar esto con LM Studio?
LM Studio expone un punto final compatible con OpenAI. Perplexica, Open WebUI, LibreChat, AnythingLLM y LlamaIndex todos se conectan a él. Apúntelos a http://localhost:1234/v1 y elija el modelo.
¿Cómo difiere el LLM local aumentado por búsqueda web de RAG en documentos locales? RAG en documentos locales busca sus propios archivos. La búsqueda web se aumenta con internet actual. La mayoría de las herramientas anteriores hacen ambas desde el mismo chat.
¿Cuál es el mejor stack de LLM local más búsqueda web gratuito? Ollama ejecutando Llama 3.1 8B, Open WebUI como interfaz, SearXNG como backend de búsqueda, todo en Docker. Gratis para siempre, sin API de terceros necesaria.
¿Puedo ejecutar esto en una portátil con 16GB de RAM? Sí para modelos 7B y 8B en cuantización Q4. Los modelos más grandes quieren 32GB o más.