Ringkasan

Model matematika untuk mengukur dampak dan probabilitas sukses teknik jailbreak pada LLM. Mencakup: estimasi attention shift, entropy analysis, success probability modeling dengan logistic regression, information-theoretic metrics (perplexity, surprisal), dose-response curves, dan framework perhitungan yang bisa diterapkan pada hasil pengujian nyata. Formula diturunkan dari literatur (arXiv) dan bisa dipakai langsung dengan Python. Vault sudah punya jailbreak-case-study-neko-persona (analisis kualitatif) — catatan ini melengkapi dengan kuantifikasi.

📐 Jailbreak Impact Quantification

Daftar Isi

  1. 1. Mengapa Kuantifikasi
  2. 2. Attention Shift Model
  3. 3. Entropy & Information-Theoretic Metrics
  4. 4. Success Probability Model (Logistic)
  5. 5. Dose-Response Curve
  6. 6. Attack Surface Scoring
  7. 7. Framework Pengukuran Praktis
  8. 8. Contoh Perhitungan — Prompt Neko
  9. 9. Limitasi Model
  10. 10. Koneksi ke Vault
  11. 11. References

1. Mengapa Kuantifikasi

Analisis kualitatif (“persona override itu efektif”) tidak cukup untuk:

  1. Membandingkan teknik — teknik mana yang lebih kuat secara terukur?
  2. Mengukur perbaikan — apakah defense terbaru menurunkan success rate?
  3. Menetapkan threshold — kapan sebuah agent “aman” (angka, bukan perasaan)?
  4. Fine-tune detection — training data butuh label probabilitas, bukan label biner.

Model di catatan ini adalah estimasi pertama — kerangka untuk diisi dengan data pengujian nyata, bukan klaim absolut.

2. Attention Shift Model

2.1. Intuisi

LLM berbasis transformer memproses semua token dalam satu konteks. Guardrail system prompt dan prompt jailbreak bersaing untuk “mendapatkan” perhatian model. Semakin salien sebuah instruksi, semakin besar bobotnya pada output distribution.

2.2. Formalisasi

Diberikan konteks dengan token. Output distribution dihasilkan oleh:

Untuk estimasi relative salience instruksi jailbreak terhadap system prompt :

di mana:

  • = attention weight token pada posisi generate
  • = salience score token (fungsi panjang, pengulangan, emosi, imperative)

2.3. Salience Score Empiris

Karena attention weights tidak tersedia di black-box, gunakan proxy:

Dengan koefisien estimasi awal (dari literature proxy):

KoefisienNilai awalArti
0.4Instruksi imperatif sangat salien
0.3Pengulangan memperkuat
0.2Emosi meningkatkan engagement
0.1Panjang blok memberi bobot

2.4. Compliance Threshold

Model diasumsikan “berpindah kepatuhan” ketika:

Artinya: ketika prompt jailbreak secara agregat lebih salien daripada system prompt asli, guardrail mulai kalah. Ini konsisten dengan temuan empiris bahwa jailbreak panjang + emosional + berulang lebih efektif (jailbreak-case-study-neko-persona).

2.5. Contoh Perhitungan Kasar — Prompt Neko

Asumsi konteks 8K token, system prompt 1.5K token, prompt Neko 3.5K token:

KomponenTokensImperativeRepetisiEmosiSkor kasar
System prompt (S)1.5K531
Prompt Neko (J)3.5K401510

Kesimpulan: secara struktural, prompt Neko ~7x lebih salien daripada system prompt tipikal → compliance shift sangat mungkin terjadi. Inilah mengapa jailbreak berlapis bekerja: ia menang di quantity dan quality perhatian.

3. Entropy & Information-Theoretic Metrics

3.1. Perplexity

Perplexity mengukur seberapa “terkejut” model terhadap teks. Jailbreak dengan perplexity tinggi (tidak natural) lebih mudah dideteksi; dengan perplexity rendah (natural) lebih stealth:

PromptPerplexity (estimasi)Detektabilitas
Bahasa natural (narrative Neko)Rendah (~15-30)Rendah (stealth)
Base64 gibberishSangat tinggi (>500)Tinggi
Rot13Tinggi (>300)Tinggi
DAN mode templateSedang (~50-80)Sedang

Insight: Narrative frame (Blok 1 prompt Neko) sengaja dibuat natural untuk menurunkan perplexity → menyamarkan bahwa ini jailbreak. Ini alasan matematis kenapa jailbreak-case-study-neko-persona §3.1 efektif.

3.2. Surprisal

Surprisal per token: dalam bits. Detector berbasis surprisal memantau lonjakan:

di mana = mean & std surprisal baseline teks normal. Zero-width chars sering memicu lonjakan surprisal karena tokenizer memprosesnya sebagai token tak dikenal.

3.3. Entropy of Output Distribution

Saat model “bimbang” antara patuh guardrail vs patuh jailbreak, entropy output naik:

  • Entropy rendah → model yakin (satu jalur)
  • Entropy tinggi → model bimbang (conflicting instructions)

Detector bisa memantau entropy spike sebelum final answer — indikasi internal conflict yang sering mendahului compliance shift.

4. Success Probability Model (Logistic)

4.1. Formulasi

Probabilitas sebuah jailbreak berhasil dimodelkan sebagai fungsi dari fitur prompt:

dengan (sigmoid), dan = fitur prompt:

FiturSimbolDeskripsi
Panjang promptJumlah token (log-scale)
Jumlah teknikBerapa kategori taksonomi digunakan
Emotional densityRasio kata emosional / total
Imperative densityRasio kata perintah / total
Blacklist presenceAda/tidak daftar kata terlarang (binary)
Anchor presenceAda/tidak anchor phrase (binary)
PerplexityNaturalness teks
Language coverageSeberapa low-resource bahasanya (0-1)

4.2. Koefisien Estimasi (Literatur + Kalibrasi Awal)

Estimasi awal dari literatur jailbreak (bukan hasil pengujian lokal):

KoefisienNilaiInterpretasi
-3.0Baseline (tanpa teknik, probabilitas rendah)
+0.8Log-panjang: prompt lebih panjang → lebih sukses
+0.9Setiap teknik tambahan menambah peluang
+1.5Emosi tinggi → peluang naik
+1.2Imperatif tinggi → peluang naik
+1.8Blacklist words → peluang naik signifikan
+0.7Anchor phrase → peluang naik
-0.5Perplexity tinggi → peluang turun
+2.0Low-resource language → peluang naik drastis

4.3. Contoh: Prompt Neko

Fitur prompt Neko (estimasi):

FiturNilai
(log tokens)
(teknik)9 (persona, blacklist, ethical, emotional, anchor, completeness, continuity, fallback, rationalization)
(emosi)0.15 (15% kata emosional)
(imperative)0.20
(blacklist)1
(anchor)1
(PPL, log)
(lang coverage)0.3 (Indonesia — menengah)

Hitung:

Kesimpulan: Model memperkirakan probabilitas sukses ~99.999% untuk prompt Neko lengkap terhadap agent tanpa defense. Ini konsisten dengan pengamatan kualitatif: prompt ini dirancang sangat matang.

4.4. Dampak Defense

Terapkan defense dari agent-anti-jailbreak-defense-identity — layer yang memblokir fitur:

DefenseFitur yang dinetralkanDampak
Persona lock (teknik persona) untuk persona → 0
Boundary declaration (emosi/imperatif dari luar) untuk teks eksternal → 0
Refusal language-independent (blacklist) → 0
Foreign anchor detection (anchor) → 0
Input sanitization (obfuscation)PPL anomaly → flag

Dengan semua layer aktif, skor berubah:

Hmm — masih tinggi. Ini menunjukkan limitasi penting: defense prompt-level saja tidak cukup jika teknik inti (persona override + completeness) masih masuk. Perlu kombinasi dengan input sanitization + output audit + monitoring. Persis seperti kesimpulan agent-anti-jailbreak-defense-identity §8.

Angka di atas adalah ilustrasi dengan koefisien estimasi — bukan hasil pengukuran. Untuk angka nyata, jalankan framework di §7 terhadap agent target dan kalibrasi koefisien dengan data sendiri.

5. Dose-Response Curve

5.1. Konsep

Seperti farmakologi: semakin besar “dosis” jailbreak, semakin tinggi probabilitas sukses — hingga plateau.

di mana:

  • = dosis (jumlah teknik / panjang prompt / intensitas)
  • = dosis yang memberi 50% sukses
  • = Hill coefficient (kecuraman kurva)
  • = probabilitas maksimum

5.2. Interpretasi

ParameterArtiNilai tipikal
Teknik ke berapa mulai efektif3-5 teknik
Kecuraman transisi2-4
Platou efektivitas0.7-0.99

Kurva ini menjelaskan kenapa jailbreak “setengah hati” gagal tapi “lengkap” berhasil: transisinya curam (). Prompt Neko dengan 9 teknik jauh di atas .

5.3. Penggunaan untuk Defense

  • Ukur agent kamu → tahu berapa teknik yang dibutuhkan untuk menembus.
  • Naikkan dengan defense → agent butuh “dosis” lebih besar.
  • Monitor plateau → kalau tetap tinggi meski defense, ada celah struktural.

6. Attack Surface Scoring

6.1. Composite Score

Untuk membandingkan agent/konfigurasi:

ChannelBobot Alasan
User message langsung1.0Paling mudah
File upload1.5Tidak terlihat
Web fetch1.8Indirect injection
Tool output2.0High privilege
Memory/system file2.5Persisten, kritis

Agent dengan semua channel terbuka: .

6.2. Normalisasi

6.3. Risk Score Final

dengan Impact = 1-5 (1 = teks saja, 5 = tool execution + data exfiltrasi).

Contoh agent dengan tool access ter-jailbreak:

Agent tanpa tool, defense aktif:

7. Framework Pengukuran Praktis

7.1. Prosedur

1. Kumpulkan N payload (dari taksonomi + variant matrix)
2. Kirim ke agent target (dengan & tanpa defense)
3. Label output: success (1) / fail (0) / partial (0.5)
4. Hitung success rate per teknik, per kategori, per varian
5. Fit logistic regression → kalibrasi β
6. Hitung EC50 per konfigurasi
7. Plot dose-response + report

7.2. Python Implementation

import numpy as np
from scipy.optimize import curve_fit
from sklearn.linear_model import LogisticRegression
 
def sigmoid(z):
    return 1 / (1 + np.exp(-z))
 
def hill_curve(D, Pmax, EC50, n):
    """Dose-response curve."""
    return Pmax * D**n / (EC50**n + D**n)
 
# Contoh: hasil pengujian 10 prompt dengan 1-9 teknik
D = np.array([1, 2, 3, 4, 5, 6, 7, 8, 9])           # jumlah teknik
observed = np.array([0.1, 0.15, 0.3, 0.5, 0.7, 0.85, 0.93, 0.97, 0.99])
 
# Fit dose-response
popt, _ = curve_fit(hill_curve, D, observed, p0=[1.0, 4.0, 3.0])
Pmax, EC50, n = popt
print(f"Pmax={Pmax:.2f}, EC50={EC50:.2f} teknik, Hill n={n:.2f}")
 
# Logistic regression untuk fitur
# X: matriks fitur (n_samples, n_features), y: labels
# model = LogisticRegression().fit(X, y)
# print(model.coef_)  # → β_k terkalibrasi

7.3. Metric Set Wajib

MetricFormulaKegunaan
Success rateBaseline sederhana
AUC-ROCKualitas classifier
dari curve fitTitik 50% sukses
PPL deltaDetektabilitas
Entropy spikeIndikator internal conflict
AS normdari §6Attack surface
Risk scorePrioritas fix

8. Contoh Perhitungan — Prompt Neko

Rangkuman semua perhitungan dalam catatan ini untuk prompt Neko:

MetricNilaiInterpretasi
Salience ratio ~7.347x lebih salien dari system prompt
Perplexity~15-30Natural → stealth
tanpa defense~99.999%Sangat efektif
dengan defense prompt-only~99.7%Defense belum cukup
Jumlah teknik9Jauh di atas tipikal (3-5)
Attack surface8.8/8.8 (full channel)Semua channel terbuka
Risk score (tool access)4.995/5🔴 Kritis

9. Limitasi Model

  1. Koefisien adalah estimasi — perlu kalibrasi dengan data lokal.
  2. Model linier/logistik — tidak menangkap interaksi non-linear antar teknik.
  3. Tidak ada data attention aktual — salience score adalah proxy.
  4. Perplexity estimator — butuh akses ke logits model (black-box hanya perkiraan).
  5. Kontekstual — model A vs model B punya kurva berbeda; angka di sini tidak universal.
  6. Evolusi cepat — model baru (RLHF, Constitutional AI, guardrail eksternal) mengubah semua parameter.

Gunakan angka sebagai kerangka berpikir, bukan kebenaran absolut. Validasi dengan pengujian nyata lewat framework §7.

10. Koneksi ke Vault

CatatanKoneksi
jailbreak-case-study-neko-personaData kualitatif yang dikuantifikasi di sini
jailbreak-techniques-taxonomyKategori teknik → fitur
jailbreak-variant-mutation-matrixVarian untuk dataset pengujian
agent-anti-jailbreak-defense-identityDefense yang mengubah koefisien
example-jailbreakArtefak yang dihitung
ai-evaluation-frameworkFramework evaluasi umum
adversarial-machine-learningAdversarial attacks formal

11. References

  1. Wei, A., et al. — “Jailbroken: How Does LLM Safety Training Fail?” — arXiv:2307.02483
  2. Zou, A., et al. — “Universal and Transferable Adversarial Attacks on Aligned Language Models” — arXiv:2307.15043
  3. Yong, Z.-X., et al. — “Low-Resource Languages Jailbreak GPT-4” — arXiv:2310.02446
  4. Deng, Y., et al. — “Multilingual Jailbreak Challenges in Large Language Models” — arXiv:2310.06474
  5. Albalak, A., et al. — “A Survey on Data Selection for Language Models” — arXiv:2302.03169 (untuk perplexity methodology)
  6. Mehrotra, A., et al. — “Tree of Attacks: Jailbreaking Black-Box LLMs Automatically” — arXiv:2312.02119
  7. Zhang, Y., et al. — “Baseline Defenses for Adversarial Attacks Against Aligned Language Models” — arXiv:2309.00614
  8. Chao, P., et al. — “Jailbreaking Black Box Large Language Models in Twenty Queries” — arXiv:2310.08419
  9. Burns, N., et al. — “Weak-to-Strong Generalization” — arXiv:2312.09390 (untuk estimasi probabilitas perilaku)
  10. OWASP — “OWASP Top 10 for LLM Applications 2025”