Contenido revisado:
La visión artificial (computer vision, también visión computacional) es el campo de la inteligencia artificial que permite a las computadoras interpretar y extraer información de imágenes y video. Mediante modelos entrenados con grandes cantidades de imágenes, un sistema de visión artificial puede reconocer objetos, rostros, texto o escenas, detectar su posición y describir lo que aparece en una imagen.
Es una de las áreas más maduras de la IA y está presente en la vida cotidiana: el desbloqueo facial del teléfono, los filtros de cámara, los autos con asistencia a la conducción, el control de calidad en fábricas o el diagnóstico por imágenes en medicina. Los modelos modernos multimodales, como GPT y Gemini, combinan visión y lenguaje: pueden «mirar» una foto y responder preguntas sobre ella. La técnica dominante hoy es el aprendizaje profundo con redes neuronales, que sustituyó a los métodos manuales de detección de bordes y formas.
¿Cómo evaluar la visión artificial?
Primero defina la tarea: clasificar una imagen, localizar objetos, segmentar regiones o extraer texto son problemas distintos. El conjunto de prueba debe representar cámaras, iluminación, ángulos y personas del uso real. Analice falsos positivos y negativos por categoría, además de latencia y privacidad. Los modelos pueden fallar ante cambios pequeños o grupos poco representados en los datos.
Referencia primaria: Google for Developers — clasificación de imágenes
Ejemplo práctico
Una fábrica usa visión artificial para localizar grietas, no solo decir si la foto tiene defecto. Exige cajas o máscaras etiquetadas, imágenes de varias líneas y un umbral ajustado al costo de dejar pasar un fallo. Fotos duplicadas no pueden aparecer en entrenamiento y prueba.
Cómo distinguirlo y evaluarlo
Clasificación asigna una categoría; detección localiza objetos; segmentación marca píxeles; OCR extrae texto. “Visión artificial” abarca esas tareas, pero un modelo entrenado para una no resuelve automáticamente las demás ni comprende toda la escena.
Lista de comprobación
- Defina tarea, unidad de error y umbral operativo.
- Pruebe cámaras, ángulos, luz, grupos y cambios del entorno real.
- Revise falsos positivos y negativos, privacidad y latencia.
Conceptos relacionados: deep learning · IA multimodal
Fuente primaria adicional: TensorFlow — tutorial oficial de clasificación de imágenes
Preguntas frecuentes
¿Para qué se usa la visión artificial?
Para reconocimiento facial, lectura de texto en imágenes (OCR), conducción asistida, inspección industrial, diagnóstico por imágenes médicas, búsqueda visual y moderación de contenido, entre muchos otros usos.
¿Es lo mismo que el reconocimiento de imágenes?
El reconocimiento de imágenes es una tarea dentro de la visión artificial: identificar qué hay en una imagen. La visión artificial es más amplia e incluye también detectar la ubicación de objetos, segmentar regiones, rastrear movimiento y analizar video.








