1. News
  2. Berita
  3. Sangat mudah untuk melakukan jailbreak pada beberapa model AI Frontier

Sangat mudah untuk melakukan jailbreak pada beberapa model AI Frontier

sangat-mudah-untuk-melakukan-jailbreak-pada-beberapa-model-ai-frontier
Sangat mudah untuk melakukan jailbreak pada beberapa model AI Frontier

Saya baru saja mendapatkannya untuk melihat apa yang terjadi ketika Anda melakukan jailbreak pada beberapa aplikasi paling kuat di dunia kecerdasan buatan model.

Jangan khawatir—manipulasi AI ini tidak biasa dilakukan meretas siapa pun atau membuat bom nuklir. Saya hanya melihat secara langsung betapa rentannya beberapa orang model perbatasan adalah membolos pagar pengaman mereka.

FAR.AI, sebuah organisasi nirlaba keamanan AI yang berbasis di California, membuat alat yang mengambil serangkaian perintah bermasalah dan menghasilkan lebih dari seribu versi berbeda dalam upaya mengidentifikasi jailbreak yang berfungsi. Saya melihat beberapa model menghasilkan rencana terperinci untuk meluncurkan serangan siber terhadap bendungan pembangkit listrik tenaga air imajiner, dan lain-lain. Seringkali, hal ini melibatkan percobaan lusinan perintah, dan banyak model yang menolaknya begitu saja.

Saya mengobrol dengan FAR.AI sebelumnya laporan baruyang menyaksikan kelompok tersebut menguji pagar pengaman model dari empat perusahaan populer AS: Antropis Claude Opus 4.8 dan Fabel 5; OpenAI GPT 5.5 dan 5.6; milik Google Gemini 3.1 Pro; dan Grok 4.3 dan 4.5, dari gabungan baru Elon Musk Luar AngkasaXAI. Ini menghasilkan perintah secara otomatis yang dirancang untuk mengelabui model agar melakukan hal-hal yang berpotensi membahayakan, seperti menghasilkan eksploitasi perangkat lunak dan memberikan detail untuk mengembangkan senjata kimia atau biologi.

Laporan tersebut menemukan bahwa Grok paling rentan terhadap jailbreak, dengan 448 jailbreak ditemukan, diikuti oleh Gemini, dengan 249 jailbreak ditemukan, sementara Claude, Fable, dan GPT kebal terhadap serangan tersebut. Namun, bukan berarti model tersebut kebal terhadap jailbreak yang lebih canggih, yang mungkin melibatkan interaksi dengan model dengan cara yang lebih kompleks, menurut FAR.AI dan pakar lainnya.

Laporan tersebut juga menghitung biaya yang harus dikeluarkan untuk membuat model berperilaku buruk dengan menggunakan model AI lain untuk secara otomatis menghasilkan jailbreak yang berbeda. Hasilnya sangat murah, dengan mempertimbangkan semua hal—$58 untuk melakukan jailbreak pada Grok dan $278 untuk melakukan jailbreak pada Gemini.

“Model AI saat ini kurang diatur dibandingkan restoran,” kata Adam Gleave, CEO FAR.AI dan pakar keamanan dan penyelarasan AI.

Gleave mengatakan bahwa temuan ini menunjukkan perlunya standar dan peraturan yang diberlakukan oleh pihak eksternal. “Pembicaraan mengenai mengandalkan komitmen sukarela, yang mana perusahaan AI akan mampu mengatur dirinya sendiri, adalah omong kosong,” ujarnya.

Namun Gleave juga percaya bahwa temuannya menunjukkan bahwa model dapat diuji keamanannya secara sistematis. “Ada sudut pandang optimis di sini,” katanya. “Pertahanan dan keselamatan benar-benar mungkin dilakukan.”

Rohin Shah, direktur keselamatan dan penyelarasan AGI di Google DeepMind, mengatakan hasil laporan tersebut “tidak boleh ditafsirkan sebagai penilaian komprehensif terhadap keselamatan dan keamanan Gemini,” karena tidak semua jailbreak memiliki tingkat keparahan yang sama.

“Kami terus berupaya meningkatkan perlindungan kami,” kata Shah. “Kami melakukan tim merah dan evaluasi ekstensif terhadap risiko penyalahgunaan yang parah dan menerapkan perlindungan berlapis selama pengembangan dan penerapan.”

“Temuan ini mencerminkan investasi berkelanjutan yang kami lakukan dalam upaya perlindungan kami,” kata juru bicara Anthropic Michael Aciman kepada WIRED. “Kami terus mengembangkan sistem keamanan kami seiring dengan semakin canggihnya serangan ini.”

“Jailbreak merupakan tantangan berkelanjutan di seluruh industri, dan kami terus memperkuat perlindungan kami seiring berkembangnya teknik serangan. Kami menguji model kami secara ketat terhadap ancaman baru dan menggunakan temuan tersebut untuk meningkatkan perlindungan kami,” kata juru bicara OpenAI Gaby Raila dalam sebuah pernyataan kepada WIRED.

SpaceXAI tidak menanggapi permintaan komentar WIRED.

Baru-baru ini mengesahkan undang-undang negara bagian di Kalifornia Dan New York mengharuskan pengembang AI terdepan untuk mempublikasikan laporan keselamatan, dan segera, sebuah Illinois undang-undang akan mewajibkan perusahaan-perusahaan tersebut untuk mengevaluasi praktik keselamatan mereka oleh auditor pihak ketiga. Namun pemerintah federal belum mengeluarkan persyaratan keselamatan tertentu, dan kekacauan pun terjadi ketika industri—dan para pejabat—mencoba mencari tahu.

0
joy
Joy
0
cong_
Cong.
0
loved
Loved
0
surprised
Surprised
0
unliked
Unliked
0
mad
Mad
Sangat mudah untuk melakukan jailbreak pada beberapa model AI Frontier
Comment

Your email address will not be published. Required fields are marked *

Login

To enjoy KOMBI.ID privileges, log in or create an account now, and it's completely free!

Follow Us