Visión por computadora en tiempo real: detección de objetos, rostros y manos
Visión por ComputadoraMediaPipeDeep Learning

Visión por Computadora en Tiempo Real: Face Tracking, Finger Tracking, Reconocimiento de Objetos y Lenguaje de Señas

Construimos un sistema de visión por computadora con Python y MediaPipe capaz de rastrear rostros y manos, detectar objetos e interpretar letras en lenguaje de señas en tiempo real.

👁️
Juan Camilo Salazar
4 de agosto de 2026
·9 min de lectura

Un mismo pipeline de video, cuatro capacidades corriendo en tiempo real: rostro, manos, lenguaje de señas y objetos — todo sobre una cámara web estándar, sin GPU obligatoria.

4
Módulos de visión
25+
FPS en CPU estándar
489
Landmarks rostro + mano

Los Cuatro Módulos del Sistema

Cada uno resuelve un problema distinto sobre la misma base técnica de landmarks y detección

🧑‍💻
#01

Face Tracking

MediaPipe Face Mesh detecta 468 puntos de referencia sobre el rostro en cada frame, permitiendo ubicar ojos, cejas, nariz y boca, y calcular la orientación de la cabeza en tiempo real.

🖐️
#02

Finger Tracking

MediaPipe Hands detecta 21 puntos por mano, reconstruyendo la posición de cada dedo en el espacio: qué dedos están extendidos, distancias entre puntas y coordenadas normalizadas.

🤟
#03

Lenguaje de Señas

Sobre los landmarks de la mano, un clasificador entrenado con TensorFlow traduce la posición de los dedos a letras del alfabeto dactilológico en tiempo real.

🎯
#04

Reconocimiento de Objetos

YOLOv8 identifica decenas de clases de objetos —personas, vehículos, señales, animales— dibujando cajas delimitadoras con su nivel de confianza sobre cada frame.

Stack Tecnológico

TECNOLOGÍAUSO EN EL PROYECTO
PythonLenguaje base de todo el sistema
OpenCVCaptura de video, dibujo de anotaciones y preprocesamiento de frames
MediaPipe (Face Mesh / Hands)Detección de landmarks faciales y de manos en tiempo real
TensorFlow / KerasEntrenamiento del clasificador de letras en lenguaje de señas
YOLOv8 (Ultralytics)Detección y clasificación de objetos en la escena
NumPyProcesamiento vectorial de coordenadas y landmarks

Arquitectura del Pipeline

Del frame de la cámara a la anotación en pantalla, en seis pasos

PASO 1

Captura

OpenCV lee el frame de la cámara web en tiempo real.

PASO 2

Preprocesamiento

Conversión de color (BGR a RGB) y redimensionado del frame.

PASO 3

Inferencia por módulo

Rostro, manos, señas y objetos se procesan de forma independiente sobre el mismo frame.

PASO 4

Postprocesamiento

Normalización de coordenadas y suavizado temporal para evitar parpadeo en las detecciones.

PASO 5

Renderizado

Se dibujan landmarks, cajas delimitadoras y etiquetas con OpenCV.

PASO 6

Salida

El frame anotado se muestra en tiempo real o se transmite a otra aplicación.

Casos de Uso

Accesibilidad

Traducción de lenguaje de señas a texto para facilitar la comunicación.

Interfaces sin contacto

Control de aplicaciones mediante gestos de mano.

🛡️

Seguridad y monitoreo

Conteo y clasificación de objetos y personas en una escena.

🎓

Educación

Herramientas interactivas para aprender el alfabeto dactilológico.

Preguntas Frecuentes

👁️

¿Quieres un sistema de visión por computadora a la medida de tu proyecto?

Desde reconocimiento de gestos hasta detección de objetos en producción, construyo soluciones de visión por computadora en tiempo real adaptadas a tu caso de uso.