Skip to content
Scalable Trustworthy AI Scalable Trustworthy AI

Publications

55 papers
2026

Lost in Communication: Uncertainty Propagation in Multi-Agent Systems

ICML 2026 AgenticUQ Workshop UncertaintyLanguage models

Break the Output Geometry for Large Language Model Unlearning

ICML 2026 MemFM Workshop Privacy

It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs

arXiv arXivPDF PrivacyLanguage models

Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

arXiv arXivPDFCode Vision

MEME: Multi-entity & Evolving Memory Evaluation

arXiv arXivPDFProject Language models

CLIP Models Generalize Less Than Compositional Benchmarks Suggest

ICML 2026 CompLearn Workshop PDF GeneralisationVision

When Do Diffusion Models learn to Generate Multiple Objects?

ICML arXivPDF GeneralisationVision

How can embedding models bind concepts?

ICML Spotlight arXivPDF GeneralisationVision

MASEval: Extending Multi-Agent Evaluation from Models to Systems

ACL System Demo arXivPDFCode Language modelsEvaluation

Half-Truths Break Similarity-Based Retrieval

arXiv arXivPDFCode GeneralisationVision

Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models

ICML Oral arXivPDFCode GeneralisationVision

Universal Algorithm-Implicit Learning

Dynamics Reveals Structure: Challenging the Linear Propagation Assumption

ICML Spotlight arXivPDF PrivacyLanguage models

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

ICLR arXivPDF UncertaintyEvaluation

DISCO: Diversifying Sample Condensation for Efficient Model Evaluation

ICLR arXivPDFCodeProject Evaluation

CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally

ICLR arXivPDFCodeProject GeneralisationVision

Enhancing Multi-Image Understanding through Delimiter Token Scaling

ICLR arXivPDFCode Vision

Dr.LLM: Dynamic Layer Routing for LLMs

ICLR arXivPDFCode Language models

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

ACL arXivPDF Privacy

LLM generation novelty through the lens of semantic similarity

EMNLP Findings arXivPDFDataset Privacy
2025

Diffusion Classifiers Understand Compositionality, but Conditions Apply

NeurIPS D&B arXivPDFCode GeneralisationVision

On the Rankability of Visual Embeddings

NeurIPS arXivPDFCode Vision

OVS Meets Continual Learning: Towards Sustainable Open-Vocabulary Segmentation

NeurIPS arXivPDF GeneralisationVision

Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers

EMNLP arXivPDFCodeDataset PrivacyLanguage models

C-SEO Bench: Does Conversational SEO Work?

NeurIPS D&B arXivPDFCodeDataset Language models

Does Data Scaling Lead to Visual Compositional Generalization?

ICML arXivPDFCode GeneralisationVision

Do Deep Neural Network Solutions Form a Star Domain?

ICLR arXivPDFCode Learning

Intermediate Layer Classifiers for OOD Generalization

ICLR arXivPDF Generalisation

Decoupled Finetuning for Domain Generalizable Semantic Segmentation

ICLR PDF GeneralisationVision

Are We Done with Object-Centric Learning?

SCSL @ ICLR arXivPDFCodeProject Vision

DiCoTTA: Domain-invariant Learning for Continual Test-time Adaptation

arXiv arXivPDF Generalisation

Mitigating Shortcut Learning with Diffusion Counterfactuals and Diverse Ensembles

SCSL @ ICLR arXivPDF VisionLearning

Playing repeated games with Large Language Models

Nature Human Behaviour arXivPDF
2024

Benchmarking Uncertainty Disentanglement: Specialized Uncertainties for Specialized Tasks

NeurIPS D&B (Spotlight) arXivPDFCode Uncertainty

Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models

NAACL Findings arXivPDF Privacy

Studying Large Language Model Behaviors Under Realistic Knowledge Conflicts

CoLM arXivPDFCode Language models

Towards User-Focused Research in Training Data Attribution for Human-Centered Explainable AI

arXiv arXivPDF Privacy

Scalable Ensemble Diversification for OOD Generalization and Detection

arXiv arXivPDFCode GeneralisationUncertainty

Calibrating Large Language Models Using Their Generations Only

ACL arXivPDF Uncertainty

Pretrained Visual Uncertainties

arXiv arXivPDFCode Uncertainty

TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification

ACL Findings arXivPDF PrivacyEvaluation
2023

ID and OOD Performance Are Sometimes Inversely Correlated on Real-world Datasets

NeurIPS arXivPDF Generalisation

URL: A Representation Learning Benchmark for Transferable Uncertainty Estimates

NeurIPS D&B arXivPDFCode Uncertainty

A Bayesian Perspective On Training Data Attribution

NeurIPS arXivPDFCode PrivacyUncertainty

Exploring Practitioner Perspectives On Training Data Attribution Explanations

NeurIPS XAI in Action Workshop arXivPDF Privacy

Neglected Free Lunch -- Learning Image Classifiers Using Annotation Byproducts

ICCV arXivPDFCodeDataset Generalisation

Trustworthy Machine Learning

Textbook arXivPDFProject GeneralisationPrivacyUncertaintyEvaluation

Scratching Visual Transformer's Back with Uniform Attention

URL: A Representation Learning Benchmark for Transferable Uncertainty Estimates

UAI-EAI Best Student Paper arXivPDFCode Uncertainty

ProPILE: Probing Privacy Leakage in Large Language Models

NeurIPS Spotlight arXivPDF Privacy
2022

Dataset Condensation via Efficient Synthetic-Data Parameterization

ICML arXivPDFCode Learning

Weakly Supervised Semantic Segmentation Using Out-of-Distribution Data

CVPR arXivPDFCode Vision

Which Shortcut Cues Will DNNs Choose? A Study from the Parameter-Space Perspective

ICLR arXivPDF Generalisation

Google Scholar