VELÁZQUEZ RUIZ, MARITRINI (2026) CLASIFICACIÓN DE PELÍCULAS POR GÉNERO USANDO UNA ARQUITECTURA BASADA EN TRANSFORMERS. Maestría thesis, Universidad Autónoma de Chihuahua.
|
Text
Tesis Maritrini Velázquez Ruiz.pdf Download (2219Kb) | Vista Previa |
Resumen
El aprendizaje automático multimodal se centra en métodos para modelar información procedente de más de una modalidad, como texto, imagen, audio y vídeo. Es fundamental que los modelos analicen y organicen simultáneamente diversas modalidades. Los recientes avances en las aplicaciones multimodales se han atribuido principalmente a la disponibilidad de nuevos conjuntos de datos multimodales a gran escala, al aumento de la capacidad computacional y a la mejora de las representaciones de las modalidades individuales. Las plataformas digitales manejan enormes colecciones de películas, pero clasificarlas de forma automática sigue siendo un reto. Los modelos actuales suelen enfocarse solo en texto o imágenes y requieren muchos recursos. Un modelo multimodal eficiente puede mejorar los sistemas de recomendación y la organización de catálogos de películas, ofreciendo experiencias más personalizadas a los usuarios. Además, al usar menos recursos, contribuye a un desarrollo tecnológico sostenible y accesible. En este trabajo se propone una arquitectura multimodal basada en Transformers que combina un encoder visual ViT y un encoder textual BERT, ambos preentrenados, con un esquema de congelamiento parcial de capas y módulos de fusión mediante atención cruzada, además de un módulo de regularización para cada modalidad. Adicionalmente, se emplean técnicas de aumento de datos para ambas modalidades, utilizando back-translation para el texto y RandAugment para las imágenes, con el objetivo de mejorar la capacidad de generalización del modelo. La arquitectura propuesta es evaluada en los conjuntos de datos MM-IMDB y Moviescope, utilizando métricas de F1 Score y micro/macro Average Precision para clasificación multi etiqueta. Los resultados experimentales muestran que el modelo alcanza un desempeño competitivo frente a enfoques multimodales previamente reportados, superando a varios modelos de referencia y acercándose al estado del arte, a pesar de mantener un diseño más simple, destacando los resultados de 66.9 ± 0.1, 66.9 ± 02 y 67.1 ± 0.1 para μ − F 1, W − F 1 y s − F 1, respectivamente, en el conjunto de datos MM-IMDB; además de los resultados del 76.5 ± 0.6 en μAP , 74.8 ± 0.4 mAP , 78.3 ± 0.4 weighted- AP y 84.6 ± 0.4 samples-AP, para el conjunto de datos Moviescope. Estos resultados sugieren que una adecuada combinación de encoders preentrenados, estrategias de fusión y aumento de datos puede ofrecer un balance efectivo entre rendimiento y complejidad del modelo.
| Tipo de Documento: | Tesis (Maestría) |
|---|---|
| Palabras Clave: | Aprendizaje Profundo, Modelos Largos de Lenguaje, Modelos Multimodales, Transformers, Visión por Computadora, Procesamiento de Lenguaje Natural. |
| Clasificación temática: | T Technology > T Technology (General) |
| Usuario Remitente: | Admin Repositorio Posgrado |
| Depositado: | 28 Ago 2026 19:58 |
| Ultima Modificación: | 28 Ago 2026 19:58 |
| URI: | http://repositorio.uach.mx/id/eprint/1038 |
Actions (login required)
![]() |
Ver Objeto |
