Hva er Multimodal AI
AI som arbeider med ulike datatyper: tekst, bilder, lyd
Multimodal AI — kunstig intelligens-systemer som kan behandle og forstå informasjon fra flere modaliteter: tekst, bilder, lyd, video.
Modaliteter
- Tekst — forstå og generere naturlig språk
- Bilder — analysere og lage visuelt innhold
- Lyd — tale- og musikkgjenkjenning og syntese
- Video — forstå dynamiske visuelle data
- Sensordata — data fra IoT-sensorer
Modelleksempler
- GPT-4V/GPT-4o — tekst + bilder + lyd
- Claude 3 — tekst + bilder
- Gemini — tekst + bilder + lyd + video
- DALL-E 3 — bildegenerering fra tekst
- Whisper — talegjenkjenning
Evner
- Bildeteksting — generere tekst fra bilder
- Visuell spørsmål og svar — svare på spørsmål om bilder
- Kryssmodal søk — søke bilder med tekst
- Multimodal generering — lage ulike innholdstyper
Forretningsanvendelser
- Innholdsmoderering — analysere bilder og tekst
- Dokumentanalyse — trekke ut data fra skanninger
- Virtuelle assistenter — forstå stemme og bilder
- Markedsføring — generere multimediainnhold