Area 3 of 5 · 10–15% of exam
Image/video generation, multimodal understanding, visual responsible AI.
gpt-image-1, FLUX, Sora 2, editing controls. · ~2 min
Vision chat, captions, Content Understanding for images & video. · ~2 min
Visual content filters, image prompt injection, policy enforcement. · ~1 min