Area 3 of 5 · 10–15% of exam

Computer vision solutions

Image/video generation, multimodal understanding, visual responsible AI.

Image & video generation

gpt-image-1, FLUX, Sora 2, editing controls. · ~2 min

Multimodal understanding

Vision chat, captions, Content Understanding for images & video. · ~2 min

Responsible AI for visual content

Visual content filters, image prompt injection, policy enforcement. · ~1 min