Synapse
⌘+K
Synapse
PulseExploreClubsResearchersJournals
Instagram
HomeClubsExplore
February 26, 2024Open Access

Defending LLMs against Jailbreaking Attacks via Backtranslation

View Full Paper
Ask AI
Bookmark
Share

Authors

YWYihan WangZSZhouxing ShiABAndrew Bai

Discussion

Loading...

Member takes

Overview

Key Points

Key points are not available for this paper at this time.

Cite This Study

Wang et al. (2024) studied this question.

synapsesocial.com/papers/68e779ebb6db6435876ee892https://doi.org/10.48550/arxiv.2402.16459
View Full Paper
Ask AI
Bookmark
Share

Also Consider

Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context:

  1. 1Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing2024
  2. 2Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks2024 · 3 citations
  3. 3Jailbreak Attacks and Defenses Against Large Language Models: A Survey2024 · 7 citations
  4. 4Studious Bob Fight Back Against Jailbreaking via Prompt Adversarial Tuning2024
  5. 5Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs2024 · 1 citations