research area
Interpretability
We develop methods that reveal what a model has learned — attribution, saliency, concept-based probes, and counterfactual analysis — and pair them with human-centered evaluation so an explanation is judged by whether it actually helps someone reason about the model, not by how it looks.
Projects
interpretability
interpretability
Attribute
An open-source toolkit for generating and evaluating attribution maps across vision architectures, from CNNs to ViTs.
Publications
How Well Do Concepts Transfer Across Multi-Modal Tasks?
Yuki Tanabe, Mira Solheim · NeurIPS · 2026
Counterfactual Attribution Maps for Vision Transformers
Sana Idris, Mira Solheim · CVPR · 2026
Open Tooling for Human-Centered Saliency Evaluation
Theo Brandt, Mira Solheim · arXiv preprint · 2025
Concept Probes as Transparent Reporting for Deployed Models
Mira Solheim, Sana Idris · NeurIPS · 2024