publications

Peer-reviewed publications and preprints on adversarial robustness, adversarial purification, and LLM safety.

2026

  1. Mitigating Distribution Shift for Adversarial Purification — paper preview
    Mitigating Distribution Shift for Adversarial Purification
    Himanshu Singh and A V Subramanyam
    2026
    Under Review
  2. Learning Adversarial Manifold for Jailbreaking at Scale — paper preview
    Learning Adversarial Manifold for Jailbreaking at Scale
    Shivank Rajput*, Himanshu Singh*, and A V Subramanyam
    2026
    *Equal Contribution Under Review
  3. EMNLP
    Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Gradient Based Subspace Intervention — paper preview
    Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Gradient Based Subspace Intervention
    In Findings of the Association for Computational Linguistics: EMNLP 2026, Oct 2026
  4. IEEE TAI
    Nearest Neighbor Projection Removal Adversarial Training — paper preview
    Nearest Neighbor Projection Removal Adversarial Training
    IEEE Transactions on Artificial Intelligence, Apr 2026

2024

  1. ICASSP
    Language Guided Adversarial Purification — paper preview
    Language Guided Adversarial Purification
    Himanshu Singh and A V Subramanyam
    In ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Apr 2024