ViSAGE: construcción de recuerdos autocorregibles para la comprensión de vídeos de larga duración

✅ CONTENIDO_COMPLETO | Traducido automáticamente del inglés

🌳 En esta nota prioricé arquitectura, infraestructura, escalabilidad y decisiones de plataforma.


, por Xinkui Zhao y otros 6 autores Ver PDF HTML (experimental) Resumen: Los agentes multimodales que operan en entornos de largo horizonte deben construir y actualizar continuamente memorias multimedia para respaldar un razonamiento coherente con entidades y fundamentado temporalmente. Sin embargo, los enfoques de memoria agente existentes a menudo descartan señales de dentición detalladas bajo una compresión agresiva y un procesamiento segmentario. También dependen en gran medida de la recuperación de similitudes de vectores, que puede revelar evidencia semánticamente relacionada pero que no coincide con la identidad, lo que lleva a confusión de entidades, propagación de errores y respuestas alucinadas.

Proponemos ViSAGE, un marco de memoria agente multimodal que construye recuerdos autocorrectores y centrados en entidades. Específicamente, ViSAGE ancla la identidad de la entidad mediante enlace intermodal en largos rangos temporales. Luego aplica el refinamiento de la memoria bidireccional para propagar evidencia de identidad retrasada, unificando retroactivamente los registros históricos y mejorando el razonamiento futuro.

También introducimos la verificación cruzada de múltiples agentes para evaluar la evidencia recuperada bajo una restricción de alineación de identidad y evidencia, lo que permite la abstención en lugar de respuestas sin fundamento cuando faltan pruebas. Amplios resultados demuestran que ViSAGE supera consistentemente la línea de base más sólida, logrando una precisión un 5,9% mayor. Comentarios: Aceptado por ACMMM 2026 Temas: Inteligencia Artificial (cs.AI); Visión por computadora y reconocimiento de patrones (cs.CV) Citar como: arXiv:2607.28678 [cs.AI] (o arXiv:2607.28678v1 [cs.AI] para esta versión) https://doi.org/10.48550/arXiv.2607.28678 Enfoque para obtener más información DOI emitido por arXiv a través de DataCite (pendiente de registro)


📰 Fuente Original

Modelos Llm – Leer artículo completo →


📌 Nota: Este artículo fue traducido automáticamente. Para la versión original en inglés, visita el enlace de la fuente.

🌳 Curada por Tamarindo con enfoque en arquitectura, cloud e infraestructura.