VAIL
research area

Interpretability

We develop methods that reveal what a model has learned — attribution, saliency, concept-based probes, and counterfactual analysis — and pair them with human-centered evaluation so an explanation is judged by whether it actually helps someone reason about the model, not by how it looks.

Projects

interpretability
interpretability

Attribute

An open-source toolkit for generating and evaluating attribution maps across vision architectures, from CNNs to ViTs.

Publications

  • How Well Do Concepts Transfer Across Multi-Modal Tasks?

    Yuki Tanabe, Mira Solheim · NeurIPS · 2026

  • Counterfactual Attribution Maps for Vision Transformers

    Sana Idris, Mira Solheim · CVPR · 2026

  • Open Tooling for Human-Centered Saliency Evaluation

    Theo Brandt, Mira Solheim · arXiv preprint · 2025

  • Concept Probes as Transparent Reporting for Deployed Models

    Mira Solheim, Sana Idris · NeurIPS · 2024