Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
Apple Research Blog
Read full postResearchers introduced Internalized Visual Thinking (IVT), a method enabling multimodal large language models to predict latent future video frames during training, improving proactive video reasoning accuracy and efficiency without generating images at inference. IVT outperforms text-only methods and matches or exceeds Visual CoT performance while reducing latency over fivefold.



