7 Juni 2026•baca 4 menit

Di Balik Dapur JEPA: Rahasia EMA, VICReg, dan Efisiensi Komputasi

Bosen sama AI yang cuma jago nebak kata atau ngafalin pixel? Kenalan sama JEPA, arsitektur revolusioner yang ngajarin mesin punya "akal sehat" secara super efisien. Yuk intip jeroan teknisnya!

Di Balik Dapur JEPA: Rahasia EMA, VICReg, dan Efisiensi Komputasi

Dunia AI saat ini memang lagi heboh-hebohnya dengan model generatif. Tapi kalau kita menggeser fokus sedikit dari hype pembuatan gambar atau teks, ada satu revolusi besar di bidang Self-Supervised Learning (SSL) yang diusung oleh Yann LeCun, yaitu JEPA (Joint-Embedding Predictive Architecture).

Konsep ini pada dasarnya mencoba menjawab satu masalah fundamental: bagaimana cara kita mengajari mesin untuk punya pemahaman atau "akal sehat" tentang dunia, tanpa harus menyuapinya dengan label data terus-menerus? Buat yang suka ngoprek arsitektur model, JEPA ini nawarin pendekatan yang sangat berbeda dan super elegan dibandingkan metode konvensional.

Mari kita bongkar jeroannya dan lihat kenapa arsitektur ini jadi bahan perbincangan hangat di kalangan peneliti.

JEPA vs Masked Auto Encoders (MAE): Beda Arena Pertarungan

Selama ini, kalau kita ngomongin representation learning lewat metode masking, nama yang paling sering muncul adalah Masked Auto Encoders (MAE). Cara kerja MAE cukup straightforward: tutupi sebagian besar patch dari sebuah gambar (atau data lainnya), lalu minta decoder untuk merekonstruksi ulang pixel yang hilang tersebut.

Masalahnya, dunia nyata itu sangat bising dan penuh dengan detail yang sebenarnya nggak penting. Meminta model untuk menebak posisi presisi setiap helai daun yang tertiup angin atau tekstur spesifik dari sebuah karpet adalah pemborosan kapasitas komputasi. Model dipaksa menghafal noise frekuensi tinggi.

Di sinilah JEPA mengambil jalan pintas yang cerdas. JEPA tidak menebak pixel. Arsitektur ini menebak representasi abstrak (embedding) dari target di dalam latent space. Daripada menyuruh model "menggambar ulang" bagian yang hilang, JEPA lebih seperti menyuruh model "menjelaskan konsep" dari bagian yang hilang tersebut. Dengan memprediksi embedding ketimbang pixel, JEPA bisa mengabaikan detail-detail kosmetik yang tidak bisa diprediksi dan memfokuskan bobotnya pada fitur-fitur semantik yang esensial.

Mencegah "Representation Collapse" dengan EMA dan VICReg

Tantangan terbesar ketika kita menyuruh jaringan saraf untuk memprediksi embedding dari jaringan saraf lain adalah risiko representation collapse. Ini adalah mimpi buruk di mana model tiba-tiba menjadi sangat malas dan memutuskan untuk mengeluarkan vektor konstan (misalnya nol semua) untuk input apa pun. Loss akan anjlok jadi nol, tapi model kita tidak belajar apa-apa.

Untuk mencegah kiamat collapse ini, JEPA menggunakan dua trik teknis yang sangat krusial:

Pertama, penggunaan EMA (Exponential Moving Average) pada target encoder. Dalam arsitektur JEPA, target encoder tidak pernah di-update secara langsung melalui backpropagation. Alih-alih, bobotnya diperbarui pelan-pelan menggunakan rata-rata pergerakan dari context encoder. Mekanisme EMA ini memastikan bahwa "guru" (target encoder) selalu berevolusi dengan stabil dan berada satu langkah di depan "murid" (predictor), sehingga prediktor memiliki target yang konsisten namun dinamis untuk dikejar.

Kedua, implementasi regulasi tambahan seperti VICReg (Variance-Invariance-Covariance). Ini ibarat satpam yang menjaga kualitas latent space:

  • Variance: Memaksa agar embedding tetap memiliki variasi, sehingga titik-titik data tidak runtuh menyatu ke satu nilai konstan.
  • Covariance: Mendekorelasikan setiap dimensi dari matriks embedding, memastikan bahwa model tidak mempelajari informasi yang redundan di berbagai dimensi yang berbeda. Setiap dimensi dipaksa untuk menangkap fitur yang unik.
  • Invariance: Memastikan bahwa prediksi kita tetap tangguh dan konsisten meskipun ada distorsi pada input.

Kombinasi EMA dan regulasi seperti VICReg inilah yang membuat model tetap waras dan terus mengekstrak fitur yang kaya makna.

Keuntungan Asimetri: Efisiensi Komputasi yang Maksimal

Satu lagi hal yang bikin JEPA sangat seksi secara arsitektur adalah desain asimetrisnya yang sangat efisien.

Pada MAE tradisional, kita sering kali membutuhkan decoder yang lumayan berat untuk memetakan kembali dari latent space ke dimensi pixel beresolusi tinggi. Di JEPA, pendekatannya sama sekali berbeda. Kita punya context encoder yang hanya memproses bagian input yang tidak tertutup (unmasked). Kemudian, predictor network yang bertugas memprediksi target biasanya didesain sangat kecil dan ringan (sering kali hanya narrow transformer).

Karena kita tidak pernah melakukan rekonstruksi kembali ke pixel space, kita memotong habis beban komputasi yang biasanya dipakai untuk rendering data. Prediktor cukup beroperasi murni di latent space. Desain asimetris ini membuat iterasi eksperimen menjadi jauh lebih cepat dan pemakaian memori jauh lebih hemat, sehingga kita bisa melakukan scaling ke model yang jauh lebih besar atau memproses rentang waktu (seperti video atau sinyal berurutan) dengan jauh lebih efisien.

Jadi Intinya...

Evolusi dari memprediksi pixel (MAE) menjadi memprediksi representasi abstrak (JEPA) adalah sebuah pergeseran paradigma yang sangat fundamental. Dengan bantuan EMA dan VICReg untuk menjaga integritas latent space, serta desain asimetris yang memaksimalkan efisiensi komputasi, JEPA membuktikan bahwa AI tidak perlu menghafal setiap debu di alam semesta untuk bisa memahaminya. Terkadang, memahami "gambaran besarnya" saja sudah cukup untuk membangun kecerdasan mesin yang tangguh dan skalabel. Ke depannya, pendekatan prediksi latent semacam ini sepertinya akan menjadi pondasi standar untuk membangun arsitektur yang benar-benar paham hukum sebab-akibat di dunia nyata.

Biar makin jago ngoding.

Yuk gabung bareng temen-temen developer lainnya buat dapet update teknologi, tips, dan tutorial santai tiap minggu.

Biar Nggak Kudet

Update teknologi, tips ngoding, dan insight santai langsung ke email kamu tiap minggu.

Santai, anti spam. Bisa berhenti langganan kapan aja.

Baca Selanjutnya

Lihat semua

© 2026 Inva.dev.