GLOSSARY
멀티모달
텍스트만 다루지 않고 이미지 이해·오디오 생성·비디오 시청 등 여러 매체를 동시에 다루는 모델입니다.
멀티모달 모델은 한 가지 이상의 데이터를 처리합니다. 텍스트에 이미지·오디오·비디오까지. ChatGPT에 사진을 보여주고 질문하거나, 음성으로 프롬프트를 받아쓰거나, 비디오를 Gemini에게 분석시킬 수 있습니다 — 모두 같은 인터페이스로.
멀티모달은 이 디렉터리의 모든 카테고리를 조용히 바꾸고 있습니다. 어시스턴트는 스크린샷을 이해하고, 비디오 생성기는 정지 이미지를 해석하며, 오디오 모델은 샘플에서 목소리를 복제합니다. 텍스트 전용 시스템이 못 했던 시각장애인용 이미지 설명·음성 전사 같은 접근성 사례도 열었습니다.