El lanzamiento de NVIDIA DeepStream 9.1 como código abierto devolvió otra piedra angular de la visión de IA a manos de la comunidad. Se une a una pila madura de herramientas de código abierto que ya cubre todo: desde etiquetado de cuadros delimitadores hasta alertas NVR locales: OpenCV para los clásicos, Ultralytics YOLO para detectores de última generación, Frigate para cámaras, CVAT y Label Studio para el pipeline de datos. Los días de pagar cinco cifras por un conjunto de visión propietario han terminado a menos que necesites específicamente soporte empresarial.
Elegimos ocho herramientas de visión por computadora de código abierto que los ingenieros realmente despliegan en 2026, desde investigación hasta producción. Las ocho funcionan en Linux, la mayoría también en macOS y Windows, y cada una se lanza bajo una licencia permisiva.
Qué buscar en una aplicación de CV de código abierto
- Mantenimiento activo. La CV se mueve rápido; un repositorio sin commits de 2025 o 2026 probablemente esté obsoleto.
- Una licencia permisiva. MIT, Apache 2.0 y BSD son seguros para uso comercial; verifica GPL/AGPL con cuidado.
- Aceleración GPU. CUDA como mínimo, idealmente con ROCm y Metal para AMD y Apple silicon.
- Zoológico de modelos reales. Los puntos de control previamente entrenados ahorran semanas de entrenamiento.
- Empaquetamiento Docker. Las pilas de visión dependen de una versión específica de CUDA; los contenedores aíslan el desorden.
- Una ruta de migración a producción. Los cuadernos de juguete están bien; probablemente quieras exportar ONNX o TensorRT.
Comparación rápida
| Herramienta | Mejor para | Licencia | Característica destacada |
|---|---|---|---|
| OpenCV | Procesamiento de imágenes fundamental | Apache 2.0 | 2.500+ algoritmos y una comunidad enorme |
| Ultralytics YOLO | Detección de objetos en tiempo real | AGPL-3.0 | YOLO v11/v12 y la API más fácil de CV |
| Frigate NVR | IA de cámara de seguridad local | MIT | Detección en dispositivo con Home Assistant |
| CVAT | Flujos de trabajo de anotación en equipo | MIT | Anotación automática SAM 3 y YOLO 11 |
| Label Studio | Etiquetado multimodal | Apache 2.0 | Texto, imágenes, audio, vídeo en una herramienta |
| Detectron2 | Investigación avanzada de detección y segmentación | Apache 2.0 | Referencias de calidad de producción de Meta |
| FiftyOne | Exploración de conjuntos de datos y QA | Apache 2.0 | Corta y trocea grandes conjuntos de imágenes |
| MMDetection | Kit de herramientas de investigación modular | Apache 2.0 | 300+ modelos de detección previamente entrenados |
Las herramientas
1. OpenCV — la mejor biblioteca de procesamiento de imágenes fundamental
OpenCV tiene 25 años y sigue siendo la primera dependencia en la mitad de los proyectos de visión del mundo. Incluye más de 2.500 algoritmos para procesamiento de imágenes, extracción de características, calibración de cámaras, seguimiento y estéreo clásico. Vinculaciones para Python, C++, Java y JavaScript, además de soporte nativo en Linux, macOS, Windows, iOS y Android.
Dónde falla: Los algoritmos clásicos son el punto; la inferencia de aprendizaje profundo a través del módulo DNN de OpenCV funciona, pero normalmente recurrirás a un framework dedicado.
Licencia: Apache 2.0 (gratis para uso comercial)
Plataformas: Linux, macOS, Windows, iOS, Android, web
Descargar: opencv.org · github.com/opencv/opencv
Conclusión: Instálalo primero. Todo en visión se basa en OpenCV en algún lugar.
2. Ultralytics YOLO — el mejor stack de detección de objetos en tiempo real
Ultralytics YOLO es la cara moderna de la familia You Only Look Once. YOLO v11 y v12 son detectores en tiempo real de última generación, y la API Python de Ultralytics es la experiencia más amigable para principiantes en visión: tres líneas de código para entrenar, evaluar y exportar.
Dónde falla: La licencia AGPL es genuinamente copyleft; si envías un producto cerrado, necesitas una licencia comercial de Ultralytics o usas un detector con licencia permisiva (Detectron2, MMDetection).
Licencia: AGPL-3.0 (licencia comercial disponible)
Plataformas: Linux, macOS, Windows (Python; CUDA/ROCm/MPS soportados)
Descargar: ultralytics.com · github.com/ultralytics/ultralytics
Conclusión: El detector de primera búsqueda predeterminado. Verifica la licencia antes de enviar comercialmente.
3. Frigate NVR — la mejor IA de cámara de seguridad local
Frigate es un grabador de video de red autohospedado con detección de objetos en el dispositivo. Funciona en una Raspberry Pi, una mini-PC o un servidor doméstico potente, usa TPU Coral o GPU NVIDIA para inferencia, y envía eventos a Home Assistant, MQTT y su aplicación nativa. Cada clip se almacena localmente; nada sale de casa.
Dónde falla: La configuración requiere leer la documentación. No todas las cámaras de consumidor funcionan bien; los streams RTSP son la opción más segura.
Licencia: MIT
Plataformas: Linux (Docker), Windows y macOS vía Docker
Descargar: frigate.video · github.com/blakeblackshear/frigate
Conclusión: El estándar de oro para una configuración de cámara de IA completamente local y privada.
4. CVAT — la mejor plataforma de anotación en equipo
CVAT (Computer Vision Annotation Tool) es la columna vertebral de código abierto del etiquetado en muchos equipos de CV. Se ejecuta como una aplicación web autohospedada, soporta cuadros delimitadores, polígonos, puntos clave y cuboides 3D, y en 2025 añadió anotación automática impulsada por SAM 3 e YOLO 11. Importación y exportación cubren formatos COCO, YOLO, Pascal VOC y TFRecord de serie.
Dónde falla: La instalación autohospedada tiene muchas partes móviles (Postgres, Redis, worker). El hospedaje SaaS está disponible si prefieres pagar para saltarte las operaciones.
Licencia: MIT (código abierto), SaaS comercial de CVAT.ai
Plataformas: Linux, macOS, Windows (Docker) o SaaS en CVAT.ai
Descargar: cvat.ai · github.com/cvat-ai/cvat
Conclusión: La opción correcta para cualquier equipo etiquetando datos a gran escala.
5. Label Studio — la mejor herramienta de etiquetado multimodal
Label Studio va más allá que CVAT: etiqueta imágenes, texto, audio, vídeo y series de tiempo en una sola interfaz. Sus plantillas personalizadas te permiten construir casi cualquier interfaz de anotación que necesites sin escribir una aplicación completa. La edición de equipo añade SSO y permisos.
Dónde falla: Para anotación de imágenes pura a gran escala, CVAT es un ajuste ligeramente mejor. Label Studio gana cuando tu conjunto de datos mezcla modalidades.
Licencia: Apache 2.0 (edición comunidad), niveles comerciales para equipos
Plataformas: Linux, macOS, Windows (Docker o Python)
Descargar: labelstud.io · github.com/HumanSignal/label-studio
Conclusión: La opción para equipos de ML multimodal.
6. Detectron2 — la mejor investigación de detección y segmentación avanzada
Detectron2 es la biblioteca de investigación CV basada en PyTorch de Meta. Envía implementaciones de referencia de calidad de producción Mask R-CNN, Panoptic FPN y DETR, y alimenta muchas investigaciones aplicadas. Bajo el capó es más explícito que Ultralytics YOLO, lo cual es una característica si necesitas modificar arquitecturas.
Dónde falla: No amigable para principiantes. El desarrollo se ha ralentizado en comparación con Ultralytics YOLO o MMDetection.
Licencia: Apache 2.0
Plataformas: Linux, macOS, Windows (PyTorch)
Descargar: github.com/facebookresearch/detectron2
Conclusión: La opción correcta para equipos de investigación y producción que prefieren implementaciones de referencia PyTorch.
7. FiftyOne — la mejor herramienta de exploración de conjuntos de datos y QA
FiftyOne de Voxel51 es la herramienta que los equipos de CV usan para entender realmente qué hay en su conjunto de datos. Corta por confianza de predicción, modo de error o calidad por clase; visualiza incrustaciones; encuentra casi duplicados. Se conecta a cada formato de modelo y etiqueta común.
Dónde falla: No es una herramienta de etiquetado. Emparéjala con CVAT o Label Studio cuando necesites anotaciones.
Licencia: Apache 2.0
Plataformas: Linux, macOS, Windows (Python)
Descargar: voxel51.com/fiftyone · github.com/voxel51/fiftyone
Conclusión: La mejor forma gratuita de auditar un conjunto de datos de CV sin escribir cuadernos desechables.
8. MMDetection — el mejor kit de herramientas de investigación modular
MMDetection de OpenMMLab es un kit de herramientas modular con más de 300 modelos de detección previamente entrenados. Lee un archivo de configuración y ensambla backbones, heads y pérdidas. Si necesitas probar tres arquitecturas contra tus datos en un fin de semana, MMDetection es más rápido que reimplementarlas tú mismo.
Dónde falla: El enfoque impulsado por configuración es poderoso pero tiene una curva de aprendizaje pronunciada. La calidad de la documentación varía según el módulo.
Licencia: Apache 2.0
Plataformas: Linux (recomendado), macOS, Windows (PyTorch)
Descargar: github.com/open-mmlab/mmdetection
Conclusión: La opción correcta para equipos de investigación que comparan muchas arquitecturas.
Cómo elegir la correcta
- Instala OpenCV en cualquier máquina que toque píxeles.
- Recurre a Ultralytics YOLO para experimentación rápida y prototipos.
- Despliega Frigate si quieres un sistema de cámara de IA privada en casa.
- Usa CVAT o Label Studio para etiquetar tu conjunto de datos (CVAT para trabajo pesado de imágenes, Label Studio para multimodal).
- Muévete a Detectron2 o MMDetection cuando necesites modificar arquitecturas.
- Usa FiftyOne para entender tus datos antes de reentrenar.
Un stack pragmático de 2026 para la mayoría del trabajo aplicado se parece a OpenCV + Ultralytics YOLO + CVAT + FiftyOne, con Frigate a un lado para proyectos de cámara en casa.
FAQ
¿Cuál es la mejor biblioteca de visión por computadora de código abierto?
OpenCV sigue siendo la base ampliamente utilizada. Para detección de aprendizaje profundo, Ultralytics YOLO es lo más fácil para empezar, y Detectron2 es la alternativa más establecida respaldada por Meta.
¿OpenCV realmente es gratuito para uso comercial?
Sí. OpenCV se licencia bajo Apache 2.0, que permite uso comercial sin regalías.
¿Necesito CUDA para visión por computadora?
Para trabajo clásico de OpenCV, no. Para detección y segmentación de aprendizaje profundo con YOLO, Detectron2 o MMDetection, una GPU NVIDIA con CUDA es el camino más suave. ROCm en AMD y MPS en Apple silicon son viables pero menos probados en algunas bibliotecas.
¿Puedo ejecutar modelos de visión por computadora en una Raspberry Pi?
Sí. Frigate está diseñado para este escenario exacto, especialmente cuando se empareja con un Coral USB TPU. Los modelos Ultralytics YOLO nano también funcionan en Pi 5 sin aceleración.
¿Qué herramienta debo usar para etiquetar imágenes?
CVAT para proyectos de anotación pesada de imágenes; Label Studio si también necesitas anotar texto, audio o vídeo en la misma herramienta. Ambas son gratuitas para autohospedar.
¿Es NVIDIA DeepStream código abierto?
Sí, desde el lanzamiento de versión 9.1 de NVIDIA en 2026, el framework es código abierto. Es especialmente útil para pipelines multi-cámara streaming en dispositivos Jetson.