VisionXLab/FIRM-Video-8B-InternVL3
Image-Text-to-Text • 8B • Updated • 12
None defined yet.
FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling
Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation