1RA EDICIÓN · PROGRAMA DE ESPECIALIZACIÓN 2026

Deep Learning y Visión por Computadora Aplicada

Formación especializada en el diseño, entrenamiento, evaluación y despliegue de modelos de aprendizaje profundo para la clasificación, detección, segmentación y generación de imágenes, con PyTorch, OpenCV, YOLO, Vision Transformers y modelos de difusión.

🎉 20% de descuento por inscripción antes del 30 de setiembre
11 Nov
Inicio 2026
130 h
Académicas
16 sem
Duración
100%
Virtual
Por qué elegirnos

Formación rigurosa en
aprendizaje profundo aplicado

El plan de estudios construye el conocimiento de manera progresiva y verificable: desde la neurona artificial y los fundamentos matemáticos del aprendizaje profundo hasta el procesamiento digital de imágenes, las arquitecturas convolucionales, la detección y segmentación de objetos, los Vision Transformers, la IA generativa visual y la puesta en producción de sistemas.

Metodología basada en proyectos

Cada módulo integra fundamentos teóricos, casos de aplicación y un proyecto entregable. El participante culmina el programa con un portafolio de ocho sistemas de visión artificial desarrollados, evaluados y desplegados.

Docente investigador URP

El programa está a cargo de un docente investigador de la Universidad Ricardo Palma, calificado en RENACYT, con proyectos financiados por PROCIENCIA-CONCYTEC y producción científica indexada en Scopus y Web of Science.

Cobertura integral de la visión artificial

Estudio de la clasificación, detección, seguimiento, segmentación y generación de contenido visual, con aplicaciones en salud, manufactura, retail, agricultura, seguridad y medios.

Interpretabilidad e IA responsable

Aplicación de técnicas de explicabilidad como SHAP, LIME, Grad-CAM y attention rollout, junto con el análisis de robustez, sesgos y la documentación mediante Model Cards.

8
Módulos
63
Sesiones
16
Semanas
8
Proyectos entregables
Plan de estudios

8 módulos · 63 sesiones1RA EDICIÓN

Estructura curricular progresiva que articula fundamentos teóricos, casos de aplicación y proyectos entregables a lo largo de 16 semanas. Selecciona cada módulo para consultar sus sesiones.

MÓDULO I Fundamentos de Deep Learning para VisiónDe la neurona artificial al primer clasificador explicable 12 sesiones
  • Semana 01
  • S01Introducción a Deep Learning y Visión por Computadora: tipos de problemas, aplicaciones y flujo de trabajo de un proyecto de IA
  • S02De la neurona artificial a las redes multicapa: perceptrón, pesos, sesgos, capas y funciones de activación
  • S03Cómo una red neuronal produce una predicción: representación matricial y propagación hacia adelante
  • S04Cómo aprende una red neuronal: funciones de pérdida, retropropagación y regla de la cadena
  • Semana 02
  • S05Optimización del entrenamiento: descenso de gradiente, SGD, momentum, RMSProp y Adam
  • S06Estabilidad y generalización: problemas del gradiente, inicialización, dropout, batch normalization y early stopping
  • S07Diagnóstico y evaluación: sobreajuste, subajuste, curvas de aprendizaje, métricas y validación
  • S08Caso 1.1: Entrenamiento y experimento comparativo de una red neuronal sobre datos reales
  • Semana 03
  • S09PyTorch para Deep Learning: tensores, autograd, nn.Module, Dataset y DataLoader
  • S10La imagen como dato: píxeles, canales, dimensiones, normalización y representación
  • S11Interpretabilidad de modelos: fundamentos de explicabilidad con SHAP y LIME
  • S12Proyecto 1: Clasificador de imágenes con red neuronal densa, diagnóstico y explicabilidad
MÓDULO II Procesamiento Digital de Imágenes con OpenCVLa imagen como dato: color, filtros, bordes y forma 4 sesiones
  • Semana 04
  • S13Representación del color, umbralización y transformaciones geométricas: escalado, interpolación y rotación
  • S14Convolución y filtrado espacial: filtros gaussianos, mediana, bilateral y detección de bordes con Sobel y Canny
  • S15Corrección de iluminación y análisis de forma: histogramas, CLAHE, contornos y operaciones morfológicas
  • S16Proyecto 2: Pipeline reproducible de procesamiento visual y cuantificación de su impacto en el modelo
MÓDULO III Redes Convolucionales y Transfer LearningArquitecturas CNN y modelos preentrenados para datos limitados 8 sesiones
  • Semana 05
  • S17Fundamentos de las CNN: convolución, filtros, padding, stride, pooling y campos receptivos
  • S18Anatomía de una CNN: mapas de características, parámetros y jerarquía de representaciones
  • S19Evolución de las CNN: LeNet, AlexNet, VGG, Inception y ResNet
  • S20Caso 3.1: Clasificación con CNN desde cero y comparación frente a la red neuronal densa
  • Semana 06
  • S21Arquitecturas eficientes y modelos preentrenados: MobileNet, EfficientNet y ecosistema Hugging Face
  • S22Transfer learning y fine-tuning: extracción de características, descongelamiento progresivo y adaptación al dominio
  • S23Aumento de datos y estrategias para datasets pequeños: transformaciones y Albumentations
  • S24Proyecto 3: Clasificador visual con transfer learning, evaluación e interpretación con Grad-CAM
MÓDULO IV Detección de ObjetosLocalizar, seguir y contar objetos en imágenes y video 8 sesiones
  • Semana 07
  • S25Fundamentos de detección de objetos: bounding boxes, anotaciones y formulación del problema
  • S26Evaluación de detectores: IoU, precisión, recall, mAP y análisis de errores
  • S27Arquitectura YOLO: predicción unificada, postprocesamiento y flujo completo de inferencia
  • S28Caso 4.1: Inferencia con Ultralytics sobre imágenes, video y flujo en tiempo real
  • Semana 08
  • S29Construcción de datasets de detección: anotación, organización y preparación de datos
  • S30Caso 4.2: Entrenamiento de YOLO con clases propias y análisis sistemático de errores
  • S31Detectores de dos etapas y seguimiento: Faster R-CNN, Detectron2, tracking multiobjeto y estimación de pose
  • S32Proyecto 4: Sistema de detección, seguimiento y conteo validado sobre video real
MÓDULO V Segmentación y DespliegueClasificación por píxel y aplicaciones en producción 8 sesiones
  • Semana 09
  • S33Fundamentos de segmentación semántica: clasificación por píxel, máscaras y funciones de pérdida
  • S34Arquitecturas encoder-decoder: redes totalmente convolucionales y U-Net
  • S35Caso 5.1: Entrenamiento de U-Net con máscaras personalizadas
  • S36Segmentación de instancias y modelos fundacionales: Mask R-CNN y Segment Anything (SAM)
  • Semana 10
  • S37Diseño de aplicaciones de inferencia: backend, latencia, manejo de errores y escalabilidad
  • S38Interfaces para modelos de visión con Gradio y Streamlit
  • S39Optimización para producción y despliegue: cuantización, exportación a ONNX y Hugging Face Spaces
  • S40Proyecto 5: Aplicación de segmentación desplegada y benchmarking de rendimiento
MÓDULO VI Vision Transformers y Modelos MultimodalesAtención, ViT, CLIP y detectores end-to-end 12 sesiones
  • Semana 11
  • S41Del paradigma convolucional al atencional: fundamentos de atención y autoatención
  • S42Vision Transformer: patch embedding, codificación posicional y arquitectura del modelo
  • S43Implementación y entrenamiento de Vision Transformers
  • S44Caso 6.1: Fine-tuning de ViT y comparación experimental frente a una CNN
  • Semana 12
  • S45Transformers visuales jerárquicos: Swin Transformer y ventanas desplazadas
  • S46Interpretación de Transformers: attention rollout y mapas de atención
  • S47Modelos visión-lenguaje: CLIP, embeddings compartidos y clasificación zero-shot
  • S48Caso 6.2: Recuperación de imágenes mediante texto con CLIP e indexación vectorial
  • Semana 13
  • S49De los detectores basados en anchors a los modelos end-to-end: DETR, object queries y matching húngaro
  • S50Implementación de DETR y análisis de convergencia y rendimiento
  • S51Evolución de los detectores Transformer: Deformable DETR, DAB-DETR, DN-DETR y DINO
  • S52Proyecto 6: Motor de búsqueda visual semántica con embeddings, indexación e interfaz de consulta
MÓDULO VII IA Generativa para VisiónDifusión, personalización, 3D y agentes multimodales 8 sesiones
  • Semana 14
  • S53Generación visual con GANs: generador, discriminador, entrenamiento y espacio latente
  • S54Modelos de difusión: proceso de ruido, proceso inverso y generación en espacio latente
  • S55Stable Diffusion y Diffusers: componentes, inferencia y control de generación
  • S56Caso 7.1: Generación condicionada con ControlNet, inpainting y outpainting
  • Semana 15
  • S57Personalización de modelos generativos: LoRA, DreamBooth y adaptación al dominio
  • S58Generación tridimensional y de video: NeRF, Gaussian Splatting y consistencia temporal
  • S59Modelos visión-lenguaje y agentes: razonamiento multimodal y Vision-Language-Action
  • S60Proyecto 7: Sistema generativo visual personalizado y demostración funcional
MÓDULO VIII Del Modelo al Producto: Proyecto FinalIA responsable, construcción del sistema y sustentación 3 sesiones
  • Semana 16
  • S61IA responsable en visión: robustez adversarial, sesgos, riesgos y Model Cards
  • S62Proyecto final: definición del problema, arquitectura de la solución y construcción del sistema
  • S63Sustentación final: presentación, defensa técnica ante jurado y evaluación del programa
PythonPyTorchOpenCVAlbumentationsHugging FaceUltralytics YOLOFaster R-CNN · Detectron2U-NetMask R-CNNSegment AnythingViT · SwinCLIPDETR · DINOSHAP · LIMEGrad-CAMStable Diffusion · DiffusersControlNetLoRA · DreamBoothNeRF · Gaussian SplattingGradio · StreamlitONNXHugging Face SpacesModel Cards
Plana docente

Docente a cargo
del programa

DOCENTE INVESTIGADOR URP · RENACYT NIVEL VI

Victor Manuel Guevara Ponce

Docente Investigador de la Universidad Ricardo Palma, Investigador RENACYT Nivel VI (CONCYTEC, P0047269) e Ingeniero Estadístico, con experiencia en ciencia de datos, machine learning, deep learning y visión por computadora.

Coordinador de Investigación del Instituto de Datos e Inteligencia Artificial (IDIA) – URP
Investigador Principal en proyectos financiados por PROCIENCIA-CONCYTEC y URP
Docente Ordinario Auxiliar de la UNMSM
Autor de publicaciones indexadas en Scopus y Web of Science
Asesor de tesis
Revisor científico internacional
Perfil de ingreso

¿A quién está dirigido?

  • Profesionales e investigadores interesados en las tecnologías más recientes de deep learning y visión por computadora.
  • Desarrolladores de software, analistas y científicos de datos que quieren implementar soluciones de visión artificial.
  • Profesionales de TI, robótica, automatización y sectores que trabajan con imágenes o video.
  • Estudiantes de maestría o doctorado que buscan aplicar visión artificial en sus investigaciones.
Salud Manufactura Retail Agricultura Seguridad Medios

CLASES SINCRÓNICAS

Sesiones en tiempo real con interacción directa con el docente

CASOS DE APLICACIÓN

Desarrollo práctico con datos reales en cada módulo

TEÓRICO – PRÁCTICO

Fundamentos conceptuales consolidados en proyectos entregables

Información general

Detalles del programa

Inicio11 de noviembre de 2026
HorarioMié · Vie — 7:00 a 10:00 PM
Modalidad100% Virtual · clases en vivo
Duración16 semanas · 130 horas académicas
Estructura8 módulos · 63 sesiones
INVERSIÓN · PÚBLICO EN GENERAL
S/ 2,500
Programa completo · 130 horas académicas
🎉 BENEFICIOS DE PREVENTA
Pago en 3 cuotas
10% de descuento por pago al contado
20% de descuento antes del 30 de Setiembre
Reservar mi cupo
* El inicio está sujeto a un número mínimo de inscripciones.
Proceso de admisión

Inscripción & certificación

Cómo inscribirte

  • 1 Completa el formulario de inscripción
  • 2 Recibe tu documento de pago
  • 3 Realiza el pago al contado o en 3 cuotas
  • 4 Envía tu voucher de pago, DNI y foto digital con fondo blanco

Certificación

Se otorgará el certificado del Programa de Especialización en Deep Learning y Visión por Computadora Aplicada, expedido por el Vicerrectorado de Investigación de la Universidad Ricardo Palma y el Instituto de Datos e Inteligencia Artificial.

Quienes cuenten con al menos el 75% de asistencia recibirán el certificado de participación; quienes obtengan una nota igual o mayor a 14 en la evaluación final recibirán el certificado de aprobación.

Asistencia mínima: 75% Nota aprobatoria: 14 / 20

Especialízate en Deep Learning y Visión por Computadora

Forma parte de la primera edición del programa y desarrolla competencias para diseñar, evaluar e implementar sistemas de visión artificial con rigor científico.

Aplica ahora
Universidad Ricardo Palma IDIA URP
Universidad Ricardo Palma · Instituto de Datos e Inteligencia Artificial