长视频理解
调研清单
| 论文 | 发表 | 状态 | 总结 | 评论 |
|---|---|---|---|---|
| Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis | arXiv 2405.21075 | ⏳ 待读 | ||
| MLVU: Benchmarking Multi-task Long Video Understanding | arXiv 2406.04264 | ⏳ 待读 | ||
| LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding | arXiv 2407.15754 | ⏳ 待读 | ||
| LVBench: An Extreme Long Video Understanding Benchmark | arXiv 2406.08035 | ⏳ 待读 | ||
| EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding | arXiv 2308.09126 | ⏳ 待读 | ||
| InfiniBench: A Comprehensive Benchmark for Large Multimodal Models in Very Long Video Understanding | arXiv 2406.19875 | ⏳ 待读 | ||
| Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context | arXiv 2605.13831 | ⏳ 待读 | ||
| MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models | arXiv 2605.14906 | ⏳ 待读 |