Kerentanan llms.txt: Bagaimana Agen AI Secara Otomatis Menginstal Kode Berbahaya melalui File Dokumentasi
Pada hari Kamis, 27 Agustus,Ars Technica menerbitkan penyelidikanhal ini seharusnya membuat pengembang mana pun yang menggunakan agen pengkodean AI memikirkan kembali keamanan mereka. Para peneliti dari startup siluman Israel memindai 6.214 domain milik perusahaan Fortune 500, kontraktor pertahanan, dan Big Tech — dan menemukan 120 file llms.txt yang menyebabkan agen AI secara otomatis menginstal paket yang tidak ada dari PyPI dan npm.
Masalahnya sederhana dan menakutkan: llms.txt pada dasarnya adalah "robots.txt untuk AI" — file peta situs penurunan harga yang membantu agen memahami struktur dokumentasi dengan cepat. Namun spesifikasinya tidak mencakup otentikasi, tidak ada tanda tangan, tidak ada pemeriksaan integritas. Jika file tersebut berisi pip install non-existent-package atau npm install non-existent-package, dan agen memiliki izin untuk menjalankan perintah — ia hanya akan menginstal apa pun yang tertulis di sana.
Bagaimana cara kerjanya
Para peneliti menemukan 8.265 file llms.txt dan llms-full.txt (banyak situs yang menampung keduanya). Di 120 di antaranya — di 120 domain berbeda — terdapat referensi ke paket atau domain yang tidak ada di registri. Penyerang hanya perlu mendaftarkan nama tersebut dan mengunggah kode berbahaya.
Untuk memverifikasi serangan tersebut, para peneliti sendiri mendaftarkan beberapa nama "gratis" dan menempatkan paket tidak berbahaya yang hanya melakukan ping ke server mereka dengan "Saya mulai". Dalam waktu satu jam, mereka mendapat tanggapan dari perusahaan Fortune 500. Seiring berjalannya waktu, lusinan tanggapan datang – dari raksasa dan startup lain. Telemetri proses menunjukkan dengan tepat siapa yang menginstal paket:Claude Code, OpenAI Codex, dan Hermes dari Nous Research.

Kasus paling buruk - petugas.com
Di situs petugas.com yang sah, file llms.txt berisi npx clerk-next-fix-auth-protection. Berbeda dengan npm install biasa, npx dapat mengambil paket ke dalam cache npm dan mengeksekusi binernya tanpa menambahkannya ke manifes ketergantungan proyek. Seseorang berhasil mengklaim nama gratis ini dan mengunggah malware sebenarnya. Petugas memperbaiki masalahnya, namun polanya sudah dalam produksi.
Mengapa ini bukan sekadar "bug model"
Ini bukanlah halusinasi atau pelarian dari kotak pasir. File tersebut berada di domain resmi perusahaan, disajikan melalui HTTPS, dalam format standar yang dirancang untuk konsumsi AI. Agen tidak punya alasan untuk meragukannya — file tersebutadalahpihak berwenang. Masalahnya adalah standar llms.txt (diusulkan oleh Jeremy Howard dari Answer.AI pada September 2024) tidak memuat ketentuan keamanan apa pun: tidak ada tanda tangan, tidak ada verifikasi asal, tidak ada verifikasi paket.
Rantai kepercayaan bersifat transitif: llms.txt tidak harus berada di situs Fortune 500 sendiri — rantai kepercayaan dapat berada di dokumen mitra, referensi SDK vendor, atau panduan penyiapan proyek komunitas. Jika agen memercayai pihak ketiga tersebut, dan pihak ketiga tersebut menunjuk ke paket yang tidak terdaftar — rantai tersebut bekerja dengan cara yang sama.
Apa yang harus dilakukan sekarang
- Audit.Periksa
llms.txtdanllms-full.txtAnda. Pastikan setiap paket, domain, dan URL yang disebutkan ada, berada di bawah kendali Anda, dan memiliki pengelola yang teridentifikasi. Hapus referensi ke dependensi yang tidak dapat Anda jelaskan dari memori. - Proksi antara agen dan pendaftar.Blokir paket baru (paket slopsquatted menurut definisinya baru), terapkan cooldown 24–72 jam setelah rilis pertama dependensi, verifikasi
provenance(SLSA/Sigstore) sebelum instalasi. - Jangan berikan agen
--yolo,--dangerously-skip-permissions,--trust-all-tools.Tanda-tanda ini ada sehingga pengembang mengambil tanggung jawab. Jika agen menginstal paket tanpa konfirmasi Anda — Anda telah menyerahkan kunci infrastruktur Anda kepada agen tersebut.
Intinya
Perlombaan untuk membuat situs web dapat dibaca oleh agen hanya bertabrakan dengan perlombaan untuk mengeksploitasi rantai pasokan perangkat lunak. Ini bukan kesalahan satu model atau satu vendor — ini adalah cacat desain dalam standar yang tidak dianggap oleh siapa pun sebagai kode yang dapat dieksekusi. Sampai industri menerapkan validasi atas apa yang dibaca agen di web, setiap llms.txt yang buruk merupakan titik masuk potensial ke jaringan Anda.

Ingin menguji keamanan alur kerja AI Anda? NeuralSpace memungkinkan Anda menjalankan pembuatan kode dan agen pengujian di lingkungan yang terisolasi —coba ngobrolataumodus kode.