Ngomongin soal AI hari ini, pasti yang jadi bintang utamanya adalah Large Language Models (LLM) seperti ChatGPT, Claude, atau Gemini. Mereka bisa nulis kode, bikin puisi, sampai ngasih saran percintaan. Sekilas, rasanya kita udah dekat banget sama yang namanya AGI (Artificial General Intelligence – alias AI yang kecerdasannya setara manusia).
Tapi, sadar nggak sih kalau kadang AI ini suka "halu" dan bikin kesalahan yang bahkan anak SD aja nggak bakal lakuin?
Nah, di kalangan para ahli AI, lagi ada perdebatan seru soal ini. Salah satu tokoh utama AI, Yann LeCun (Chief AI Scientist di Meta), dengan berani bilang kalau arsitektur LLM yang ada sekarang pada akhirnya bakal mentok. Jalan menuju AGI nggak bisa cuma ngandelin LLM. Jawabannya, menurut LeCun, ada di arsitektur baru bernama JEPA (Joint-Embedding Predictive Architecture).
Kutukan "Burung Beo" (Stochastic Parrot)
Kenapa sih LLM sering dibilang bakal mentok? Alasan utamanya ada di cara kerja mereka. LLM yang kita pakai sekarang pada dasarnya adalah mesin penebak kata (next-token prediction). Mereka dilatih dengan triliunan teks dari internet untuk menebak probabilitas kata apa yang harus muncul selanjutnya.
Masalahnya, pendekatan ini bikin LLM terjebak jadi apa yang disebut peneliti sebagai "Stochastic Parrot" atau burung beo statistik.
Ibarat burung beo yang pintar meniru suara manusia, LLM jago banget merangkai kata yang kelihatan cerdas, tapi mereka nggak benar-benar paham makna di balik kata-kata itu. Mereka nggak punya pondasi pemahaman soal dunia fisik (realitas). Makanya, kalau disuruh ngejelasin interaksi fisik antar benda atau logika sebab-akibat yang kompleks, mereka sering error atau berhalusinasi, karena pengetahuan mereka murni cuma sebatas probabilitas teks, bukan pemahaman fisika dasar.
Kenapa Yann LeCun Yakin LLM Bakal Mentok?
Di berbagai forum, Yann LeCun sering nekenin kalau model autoregressive (sistem yang memprediksi kata demi kata berulang kali) punya kelemahan fatal: akumulasi error.
Kalau AI bikin satu kesalahan kecil di awal kalimat, kesalahan itu bakal merembet dan makin parah di kalimat-kalimat berikutnya. Selain itu, LeCun berargumen bahwa bahasa (teks) itu sebenarnya adalah bentuk informasi yang sudah sangat dikompres. Banyak hal di dunia nyata (seperti gravitasi, cara benda jatuh, atau cara manusia bergerak) yang nggak bisa dijelaskan murni cuma lewat teks. Manusia dan hewan belajar dengan melihat dan berinteraksi dengan dunia fisik, bukan cuma dari baca buku.
Jadi, mau sebanyak apa pun data teks yang disuapin ke LLM, mereka nggak akan pernah bisa mencapai AGI karena mereka buta terhadap cara kerja dunia fisik. Mereka itu ibarat interface (tampilan luar) yang jago ngomong, tapi nggak punya backend (otak logika) yang kuat.
Masuklah JEPA: Memprediksi Makna di "Latent Space"
Kalau LLM itu ibarat nebak kata, dan Generative AI gambar (seperti DALL-E atau Nano Banana) itu ibarat nebak piksel warna, JEPA datang dengan cara berpikir yang beda total. JEPA nggak peduli sama token (kata) atau piksel. JEPA memprediksi di dalam Representation Space atau Latent Space (ruang abstrak/konseptual).
Gampangnya gini: Coba bayangin kamu lagi mau nyeritain sebuah foto ke temanmu. Apakah otakmu memilih kata pertama dulu, lalu mikir kata kedua, lalu kata ketiga? Nggak, kan? Otakmu bakal ngebentuk konsep utuhnya dulu (misal: "kucing oren lagi tidur di sofa"), baru setelah itu diterjemahin ke kata-kata.
Itulah inti dari riset terbaru seperti VL-JEPA (Vision-Language JEPA). Alih-alih buang-buang tenaga komputasi buat menebak setiap kata atau menggambar ulang setiap detail piksel (seperti helai bulu kucing yang nggak penting), JEPA dilatih untuk menebak "makna" atau "embedding"-nya. Ini bikin JEPA jauh lebih efisien, komputasinya lebih ringan, dan proses kerjanya jauh lebih mirip dengan cara kerja kognitif manusia.
V-JEPA: Ngajarin AI Ilmu Fisika Lewat Video
Salah satu terobosan keren dari arsitektur ini adalah V-JEPA (Video JEPA). Kalau LLM belajar dari teks, V-JEPA belajar murni dari nonton jutaan jam video tanpa label.
Karena dia bekerja di latent space, V-JEPA belajar memahami "ilmu fisika intuitif". Dia bisa memprediksi apa yang bakal terjadi di adegan selanjutnya tanpa harus merender ulang videonya. Dia jadi paham bahwa kalau ada gelas jatuh ke lantai, gelasnya bakal pecah. Ini adalah fondasi dari common sense (akal sehat) yang selama ini jadi "kryptonite" buat LLM konvensional.
Dengan model dunia (World Model) yang kuat dari V-JEPA, AI masa depan nantinya nggak cuma bisa ngobrol, tapi bisa dipakai untuk sistem robotika yang mampu merencanakan tindakan di dunia nyata tanpa perlu disuapin instruksi yang kaku.
Masa Depan: Mengawinkan "Mulut" dan "Otak"?
Jalan menuju AGI kayaknya nggak bakal dicapai kalau kita cuma ngandelin AI yang jago omong "omdo" doang haha. Perdebatan ini ngasih kita perspektif baru: LLM memang luar biasa sebagai alat komunikasi, tapi untuk jadi benar-benar pintar? AI masih butuh pondasi pemahaman dunia nyata.
Ke depannya, arsitektur masa depan bisa jadi gabungan dari keduanya. LLM jadi "mulut" (interface komunikasi) yang luwes, sementara arsitektur seperti JEPA bakal jadi "otak" (backend/world model) yang memastikan AI tersebut punya akal sehat dan paham hukum realitas.
Bukan nggak mungkin, dalam 3-5 tahun ke depan, paradigma next-token prediction bakal mulai ditinggalkan, dan kita akan masuk ke era di mana AI beneran "mikir" dulu sebelum ngomong. Kita lihat saja :D
Gimana menurutmu? Percaya kalau LLM bakal mentok, atau justru yakin kalau ChatGPT dkk masih bisa berevolusi jadi AGI?