---
格式版本: 2
标题: "VicEdit: Learning to Edit Videos from Visual In-Context Examples"
原文链接: "https://arxiv.org/abs/2608.16745"
发布日期: "2026-08-17"
发布时间校准状态: "found"
发布时间需复核: "否"
发布时间来源: "rule:scrape:strict_html_body"
发布时间证据: "citation_date: 2026/08/17"
发布时间校准原因: "规则确认唯一严格发布时间，来源 scrape:strict_html_body"
发布时间校准置信度: "high"
发布时间候选数量: 6
发布时间严格候选数量: 6
发布时间原页读取状态: ""
发布时间未找到原因: ""
发布时间校准时间: "2026-08-18T19:33:28+08:00"
发布时间仲裁状态: "skipped"
发布时间仲裁尝试次数: 0
发布时间仲裁耗时毫秒: 0
发现时间: "2026-08-18T19:33:13+08:00"
入库时间: "2026-08-18T11:33:39.732Z"
来源平台: "arXiv 学术论文搜索"
搜索渠道: "source_template"
搜索词: "https://arxiv.org/search/?query=performance&searchtype=all"
匹配关键词:
  - "performance"
相关厂家:
  []
相关专家:
  []
内容类型: "网页"
抓取工具: "Free Fetch + Defuddle"
清洗工具: "Defuddle Markdown + Defuddle/Readability 正文提取"
原始附件:
  []
AI优质: "否"
AI打分: 5
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "该资料为arXiv视频编辑论文，主题为视觉上下文视频编辑，与超节点/AI Rack/机柜级AI基础设施完全无关，无任何相关技术或商业信息。"
AI质检模型: "ali-deepseek-v4-flash"
AI质检时间: "2026-08-18T19:34:07+08:00"
AI主题相关性: 0
AI来源权威性: 5
AI新颖性: 0
AI技术细节: 0
AI商业部署信号: 0
AI完整性: 0
AI摘要: "论文提出视觉上下文编辑范式VicEdit，将视频编辑从文本指令扩展到图像、图像对和视频对等多模态视觉参考，并构建包含40万样本的VicEdit-400K数据集。"
AI摘要模型: "ali-deepseek-v4-flash"
AI摘要时间: "2026-09-07T03:24:36.336Z"
采集批次: "2026年8月18日15点52分05秒"
采集批次ID: "20260818-155205-090"
去重键: "https://arxiv.org/abs/2608.16745"
---

## Computer Science > Computer Vision and Pattern Recognition

## Title:VicEdit: Learning to Edit Videos from Visual In-Context Examples

Authors:[Yuji Wang](https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y), [Teng Hu](https://arxiv.org/search/cs?searchtype=author&query=Hu,+T), [Yuheng Chen](https://arxiv.org/search/cs?searchtype=author&query=Chen,+Y), [Ran Yi](https://arxiv.org/search/cs?searchtype=author&query=Yi,+R), [Han Feng](https://arxiv.org/search/cs?searchtype=author&query=Feng,+H), [Weijian Cao](https://arxiv.org/search/cs?searchtype=author&query=Cao,+W), [Chengjie Wang](https://arxiv.org/search/cs?searchtype=author&query=Wang,+C), [Lizhuang Ma](https://arxiv.org/search/cs?searchtype=author&query=Ma,+L), [Jiangning Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+J)

[View PDF](https://arxiv.org/pdf/2608.16745) [HTML (experimental)](https://arxiv.org/html/2608.16745v1)

> Abstract:Despite progress in instruction-based video editing, unimodal textual instructions inherently struggle to convey fine-grained textures and complex dynamics. To bridge this perceptual gap, we propose Visual In-context Editing, a new paradigm elevating video editing from textual instructions to multi-modal visual guidance encompassing single image, image pair, and video pair. To facilitate this paradigm, we curate VicEdit-400K, the first large-scale dataset for visual in-context video editing. We develop an automated pipeline to generate 400K high-quality samples across ten task types, ensuring superior visual fidelity and semantic consistency through multi-dimensional filtering. Leveraging this foundation, we introduce VicEdit, a unified framework to bridge visual and textual contexts. To adaptively extract editing semantics from heterogeneous references, we design Modality-Adaptive Semantic Distillation, which produces modality-specific semantic tokens from visual references. These tokens are then synergistically integrated with textual instructions through Dual-Context Injection, enabling the generation process to benefit from both visual and textual signals. Extensive evaluations on VicEditBench demonstrate that VicEdit achieves state-of-the-art performance across both basic instruction editing and visual in-context editing tasks, establishing visual in-context learning as a powerful and controllable paradigm for video editing.

| Subjects: | Computer Vision and Pattern Recognition (cs.CV) |
| --- | --- |
| Cite as: | [arXiv:2608.16745](https://arxiv.org/abs/2608.16745) \[cs.CV\] |
|  | (or [arXiv:2608.16745v1](https://arxiv.org/abs/2608.16745v1) \[cs.CV\] for this version) |
|  | [https://doi.org/10.48550/arXiv.2608.16745](https://doi.org/10.48550/arXiv.2608.16745) |

## Submission history

From: Yuji Wang \[[view email](https://arxiv.org/show-email/efef7710/2608.16745)\]  
**\[v1\]** Mon, 17 Aug 2026 15:55:40 UTC (22,529 KB)

[Which authors of this paper are endorsers?](https://arxiv.org/auth/show-endorsers/2608.16745) | Disable MathJax ([What is MathJax?](https://info.arxiv.org/help/mathjax.html))
