๐Ÿ‘๏ธโ€๐Ÿ—จ๏ธ VisionQuery: Multimodal AI

Sistem cerdas perpaduan Computer Vision dan NLP. Unggah gambar dan tanyakan apa saja tentang isi gambar tersebut!


๐Ÿ’ก Cara Kerja (Arsitektur Early/Late Fusion): Aplikasi ini menggunakan model Transformer yang menerima dua jenis input berbeda (Piksel Gambar dan Token Teks). AI mengekstraksi fitur dari keduanya, menggabungkannya, dan mengklasifikasikan jawaban yang paling tepat berdasarkan konteks visual.