rattlesnakey/Awesome-Actionable-MI-Survey

The Github repo for our survey paper: "Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models"

157

20 commits

updated Apr 15, 2026

See the code

README

πŸ”Ž Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models

PDF Status arXiv

Awesome GitHub stars

We will continue to update this repository.

If you enjoy or benefit from the project, a star ⭐ on GitHub would be greatly appreciated and will help you stay informed about future updates.

πŸ“– Table of Contents

πŸ“– Overview

A systematic survey on how to locate interpretable objects, steer model behaviors, and improve LLMs (Alignment, Capability, Efficiency) via Mechanistic Interpretability.

Overview Figure

Note: The figure illustrates our framework: Locate (Identifying internal objects), Steer (Manipulating behaviors), and Improve (Downstream applications).

Mechanistic Interpretability (MI) has evolved from merely observing model internals to actively intervening in them. This repository maintains a curated list of papers reviewed in our survey, focusing on Actionable MI.

πŸ”₯ Latest News

  • [2026-03-28] We have significantly updated our paper list with 18 new papers! These additions cover the latest advancements in reasoning steering, knowledge editing, efficient inference, and more. πŸš€
  • [2026-1-21] Our paper is available on arXiv! Check it out here.
  • [2026-1-20] This repository is created to track the latest progress in Actionable MI.

🏷 Taxonomy & Legends

To help navigate the paper list, we use the following abbreviations for Objects, Localizing Methods, and Steering Methods:

Interpretable Objects

The core interpretable objects in our survey are shown below:

Localizing Methods (How to find it?)

  • Magnitude Analysis: Weights or activation magnitude analysis, training-free but data-dependent
  • Causal Attribution: Patching and ablation
  • Gradient Detection: Data-dependent and incurs extra compute
  • Probing: Supervised property decoding
  • Vocab Projection: Logit Lens, direct semantic mapping
  • Circuit Discovery: Causal subnetwork identification

Steering Methods (How to control it?)

  • Amplitude Manipulation: Scaling and replace
  • Targeted Optimization: Weight editing, targeted fine-tuning
  • Vector Arithmetic: Steering via feature and task vectors

πŸ“‘ Paper List

For studies employing multiple objects or localizing/steering methods, we annotate the primary tag.

1. Improve Alignment

Safety and Reliability

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Safety Layers in Aligned Large Language Models: The Key to LLM SecurityResidual StreamCausal AttributionTargeted OptimizationICLR2025Link
Refusal in Language Models Is Mediated by a Single DirectionResidual StreamCausal AttributionVector ArithmeticNeurIPS2024Link
LLMs Encode Harmfulness and Refusal SeparatelyResidual StreamCausal AttributionVector ArithmeticNeurIPS2025Link
To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language ModelsResidual StreamProbingVector ArithmeticICML2025Link
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?Residual StreamProbingVector ArithmeticArXiv2025Link
Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMsResidual StreamVocab ProjectionAmplitude ManipulationArXiv2026Link
A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and ToxicityResidual StreamProbingTargeted OptimizationICML2024Link
Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language ModelsResidual StreamCausal AttributionVector ArithmeticArXiv2024Link
Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector AblationResidual StreamCausal AttributionVector ArithmeticICLR2025Link
Refusal Direction is Universal Across Safety-Aligned LanguagesResidual StreamCausal AttributionVector ArithmeticNeurIPS2025Link
Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in ExplanationsResidual StreamCausal AttributionVector ArithmeticICML2025Link
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution BehaviorsResidual StreamCausal AttributionVector ArithmeticICML2025Link
The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety DirectionsResidual StreamCausal AttributionVector ArithmeticICML2025Link
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language ModelsResidual StreamVocab ProjectionVector ArithmeticICLR2024Link
In-Context Sharpness as Alerts: An Inner Representation Perspective for Hallucination MitigationResidual StreamVocab ProjectionVector ArithmeticICML2024Link
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful SpaceResidual StreamProbingVector ArithmeticACL2024Link
LLMs Know More Than They Show: On the Intrinsic Representation of LLM HallucinationsResidual StreamProbingVector ArithmeticICLR2025Link
Multi-Attribute Steering of Language Models via Targeted InterventionResidual StreamGradient DetectionVector ArithmeticACL2025Link
Improving Instruction-Following in Language Models through Activation SteeringResidual Stream-Vector ArithmeticICLR2025Link
On the Role of Attention Heads in Large Language Model SafetyMHACausal AttributionAmplitude ManipulationICLR2025Link
Refine Large Language Model Fine-tuning via Instruction VectorMHACausal AttributionTargeted OptimizationArXiv2024Link
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety NeuronsNeuronCausal AttributionAmplitude ManipulationArXiv2025Link
Whispering Experts: Neural Interventions for Toxicity Mitigation in Language ModelsNeuronMagnitude AnalysisAmplitude ManipulationICML2024Link
H-Neurons: On the Existence, Impact, and Origin of Hallucination-Associated Neurons in LLMsNeuronMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Understanding and Enhancing Safety Mechanisms of LLMs via Safety-Specific NeuronNeuronMagnitude AnalysisTargeted OptimizationICLR2025Link
Neuron-Aware Data Selection in Instruction Tuning for Large Language ModelsNeuronMagnitude Analysis-ICLR2026Link
Precision Knowledge Editing: Enhancing Safety in Large Language ModelsNeuronMagnitude AnalysisTargeted OptimizationArXiv2025Link
Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 SonnetSAE FeatureMagnitude AnalysisAmplitude ManipulationBlog2024Link
Breaking Bad Tokens: Detoxification of LLMs Using Sparse AutoencodersSAE FeatureMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
Understanding Refusal in Language Models with Sparse AutoencodersSAE FeatureMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation FrameworkSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse AutoencodersSAE FeatureMagnitude AnalysisVector ArithmeticICML2025Link
Saif: A sparse autoencoder framework for interpreting and steering instruction following of language modelsSAE FeatureMagnitude AnalysisVector ArithmeticArXiv2025Link
Training Superior Sparse Autoencoders for Instruct ModelsSAE FeatureMagnitude AnalysisVector ArithmeticArXiv2025Link
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM UnitsSAE FeatureGradient Detection-ArXiv2026Link
Towards Secure Tuning: Mitigating Security Risks Arising from Benign Instruction Fine-TuningToken EmbeddingGradient DetectionVector ArithmeticArXiv2025Link
Pierce the Mists, Greet the Sky: Decipher Knowledge Overshadowing via Knowledge Circuit AnalysisMHA & FFNCircuit DiscoveryTargeted OptimizationEMNLP2025Link
On Localizing and Deleting Toxic Memories in Large Language ModelsFFNCausal AttributionTargeted OptimizationNAACL2025Link

Fairness and Bias

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Entangled in Representations: Mechanistic Investigation of Cultural Biases in Large Language ModelsResidual StreamCausal Attribution-ArXiv2025Link
MPF: Aligning and Debiasing Language Models Post Deployment via Multi Perspective FusionResidual Stream-Amplitude ManipulationICML2025Link
Mitigate Position Bias in LLMs via Scaling a Single Hidden States ChannelResidual StreamMagnitude AnalysisAmplitude ManipulationACL2025Link
Analysing Moral Bias in Finetuned LLMs through Mechanistic InterpretabilityResidual StreamCausal AttributionAmplitude ManipulationArXiv2025Link
Investigating Gender Bias in Language Models Using Causal Mediation AnalysisMHACausal AttributionAmplitude ManipulationNeurIPS2020Link
Dissecting Bias in LLMs: A Mechanistic Interpretability PerspectiveMHAMagnitude AnalysisAmplitude ManipulationTMLR2025Link
Linear Representations of Political Perspective Emerge in Large Language ModelsMHAProbingVector ArithmeticICLR2025Link
Tracing Positional Bias in Financial Decision-Making: Mechanistic Insights from Qwen2.5MHAMagnitude Analysis-ICAIF2025Link
Eliminating Position Bias of Language Models: A Mechanistic ApproachMHAMagnitude AnalysisAmplitude ManipulationICLR2025Link
Identifying and Adapting Transformer-Components Responsible for Gender Bias in an English Language ModelMHACausal AttributionTargeted OptimizationACLWS2023Link
Locating and Mitigating Gender Bias in Large Language ModelsFFNCausal AttributionTargeted OptimizationICIC2024Link
Elucidating Mechanisms of Demographic Bias in LLMs for HealthcareFFNCausal AttributionAmplitude ManipulationEMNLP2025Link
Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice QuestionsFFNVocab ProjectionTargeted OptimizationACL2025Link
Understanding and Mitigating Gender Bias in LLMs via Interpretable Neuron EditingNeuronCircuit DiscoveryTargeted OptimizationArXiv2025Link
The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language ModelsNeuronGradient DetectionAmplitude ManipulationICLR2024Link

Persona and Role

PaperObjectLocalizing MethodSteering MethodVenueYearLink
The Assistant Axis: Situating and Stabilizing the Default Persona of Language ModelsResidual StreamMagnitude AnalysisVector ArithmeticArXiv2026Link
Can Role Vectors Affect LLM Behaviour?Residual StreamCausal AttributionVector ArithmeticEMNLP2025Link
Persona vectors: Monitoring and controlling character traits in language modelsResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
From Monolingual to Bilingual: Investigating Language Conditioning in Large Language Models for Psycholinguistic TasksResidual StreamProbing-AACL2025Link
Mechanistic Interpretability of Emotion Inference in Large Language ModelsResidual StreamProbingVector ArithmeticACL2025Link
Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream EffectsResidual StreamCausal AttributionVector ArithmeticNeurIPS2025Link
Steering Llama 2 via Contrastive Activation AdditionResidual StreamCausal AttributionVector ArithmeticACL2024Link
Probing then Editing Response Personality of Large Language ModelsResidual StreamProbingTargeted OptimizationCOLM2025Link
Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AIResidual StreamCausal Attribution-ArXiv2025Link
From Rational Answers to Emotional Resonance: The Role of Controllable Emotion Generation in Language ModelsResidual Stream-Vector ArithmeticArXiv2025Link
Psychological Steering in LLMs: An Evaluation of Effectiveness and TrustworthinessResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
Steering Latent Traits, Not Learned Facts: An Empirical Study of Activation Control LimitsResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
Personality Vector: Modulating Personality of Large Language Models by Model MergingResidual StreamCausal AttributionVector ArithmeticEMNLP2025Link
Billy: Steering large language models via merging persona vectors for creative generationResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
Personas as a way to model truthfulness in language modelsResidual StreamProbing-EMNLP2024Link
Who's asking? User personas and the mechanics of latent misalignmentResidual StreamCausal AttributionVector ArithmeticNeurIPS2024Link
Understanding How Value Neurons Shape the Generation of Specified Values in LLMsNeuronCausal AttributionAmplitude ManipulationEMNLP2025Link
Neuron based Personality Trait Induction in Large Language ModelsNeuronCausal AttributionAmplitude ManipulationICLR2025Link
From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint TuningNeuronCausal AttributionTargeted OptimizationICML2024Link

2. Improve Capability

Logic and Reasoning

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Reasoning-Finetuning Repurposes Latent Representations in Base ModelsResidual StreamCausal AttributionVector ArithmeticICML2025Link
Improving Reasoning Performance in Large Language Models via Representation EngineeringResidual StreamCausal AttributionVector ArithmeticICLR2025Link
Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal PoliciesResidual StreamVocab ProjectionTargeted OptimizationArXiv2025Link
Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation EngineeringResidual StreamCausal AttributionVector ArithmeticACL2025Link
Probing for Arithmetic Errors in Language ModelsResidual StreamProbing-EMNLP2025Link
Eliciting Chain-of-Thought in Base LLMs via Gradient-Based Representation OptimizationResidual StreamProbingVector ArithmeticAAAI2026Link
Understanding Reasoning in Thinking Language Models via Steering VectorsResidual StreamCausal AttributionVector ArithmeticICLR2025Link
Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop QueriesResidual StreamProbing-EMNLP2024Link
Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning ProcessResidual StreamProbing-ICLR2025Link
The Reasoning-Memorization Interplay in Language Models Is Mediated by a Single DirectionResidual StreamCausal AttributionVector ArithmeticACL2025Link
Uncovering Latent Chain of Thought Vectors in Language ModelsResidual StreamCausal AttributionVector ArithmeticICLR2025Link
Fractional Reasoning via Latent Steering Vectors Improves Inference Time ComputeResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
Steering LLM Reasoning Through Bias-Only AdaptationResidual StreamCausal AttributionVector ArithmeticEMNLP2025Link
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language ModelsResidual StreamCausal AttributionVector ArithmeticEMNLP2025Link
ATLAS: Adaptive Test-Time Latent Steering with External Verifiers for Enhancing LLMs' ReasoningResidual StreamProbingVector ArithmeticArXiv2026Link
Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-TimeMHAProbingAmplitude ManipulationArXiv2025Link
How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric LearningMHAMagnitude AnalysisAmplitude ManipulationEMNLP2024Link
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron AnalysisMHACausal AttributionAmplitude ManipulationEMNLP2024Link
Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language ModelsMHACausal Attribution-EMNLP2025Link
Chain-of-Thought in Large Language Models: Decoding, Projection, and ActivationMHA & FFNMagnitude Analysis-ArXiv2024Link
Interpreting and Improving Large Language Models in Arithmetic CalculationMHA & FFNCausal AttributionTargeted OptimizationICML2024Link
A Mechanistic Interpretation of Arithmetic Reasoning in Language Models using Causal Mediation AnalysisMHA & FFNCausal Attribution-EMNLP2023Link
Uncovering the Interpretation of Large Language ModelsMHA & FFNCausal Attribution-COMPSAC2024Link
Understanding Addition in TransformersMHA & FFNCausal AttributionAmplitude ManipulationICLR2024Link
Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal ThinkingMHA & FFNGradient DetectionTargeted OptimizationACL2025Link
How does GPT-2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language modelMHA & FFNCircuit Discovery-NeurIPS2023Link
Arithmetic Without Algorithms: Language Models Solve Math with a Bag of HeuristicsMHA & FFNCircuit Discovery-ICLR2025Link
Sparse Autoencoders Learn Monosemantic Features in Vision-Language ModelsSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Fantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning ProcessSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Reasoning Models Generate Societies of ThoughtSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2026Link
I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse AutoencodersSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Internal states before wait modulate reasoning patternsSAE FeatureMagnitude AnalysisVector ArithmeticEMNLP2025Link
Can we interpret latent reasoning using current mechanistic interpretability tools?Token EmbeddingCausal AttributionAmplitude ManipulationBlog2025Link
Analyzing chain-of-thought prompting in large language models via gradient-based feature attributionsToken EmbeddingGradient Detection-ICML2023Link
Probabilistic Soundness Guarantees in LLM Reasoning ChainsToken EmbeddingMagnitude Analysis-EMNLP2025Link
Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional TrainingFFNMagnitude AnalysisAmplitude ManipulationArXiv2025Link

Multilingualism

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Importance-based Neuron Allocation for Multilingual Neural Machine TranslationNeuronMagnitude AnalysisAmplitude ManipulationACL2021Link
On the Multilingual Ability of Decoder-based Pre-trained Language Models: Finding and Controlling Language-Specific NeuronsNeuronMagnitude AnalysisAmplitude ManipulationNAACL2024Link
Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language ModelsNeuronMagnitude AnalysisAmplitude ManipulationACL2024Link
How do Large Language Models Handle Multilingualism?NeuronMagnitude AnalysisAmplitude ManipulationNeurIPS2024Link
Language Arithmetics: Towards Systematic Language Neuron Identification and ManipulationNeuronMagnitude AnalysisAmplitude ManipulationArXiv2025Link
On Relation-Specific Neurons in Large Language ModelsNeuronMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-EncoderNeuronMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
Sparse Autoencoders Can Capture Language-Specific Concepts Across Diverse LanguagesSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse LanguagesSAE FeatureMagnitude AnalysisAmplitude ManipulationNAACL2025Link
On the Language Neutrality of Pre-trained Multilingual RepresentationsResidual StreamProbing-EMNLP2020Link
Can Cross-Lingual Transferability of Multilingual Transformers Be Activated Without End-Task Data?Residual Stream-Vector ArithmeticACL2023Link
Identifying the Correlation Between Language Distance and Cross-Lingual Transfer in a Multilingual Representation SpaceResidual StreamMagnitude AnalysisVector ArithmeticACL2023Link
Do Llamas Work in English? On the Latent Language of Multilingual TransformersResidual StreamVocab ProjectionVector ArithmeticACL2024Link
Exploring Alignment in Shared Cross-lingual SpacesResidual StreamMagnitude AnalysisVector ArithmeticACL2024Link
Why do LLaVA Vision-Language Models Reply to Images in English?Residual StreamProbingVector ArithmeticEMNLP2024Link
ShifCon: Enhancing Non-Dominant Language Capabilities with a Shift-based Multilingual Contrastive FrameworkResidual StreamMagnitude AnalysisVector ArithmeticACL2025Link
Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language ModelsResidual StreamVocab ProjectionVector ArithmeticACL2025Link
The Semantic Hub Hypothesis: Language Models Share Semantic Representations Across Languages and ModalitiesResidual StreamVocab Projection-ICLR2025Link
Language Mixing in Reasoning Language Models: Patterns, Impact, and Internal CausesResidual StreamVocab ProjectionVector ArithmeticEMNLP2025Link
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language ModelsResidual StreamVocab ProjectionVector ArithmeticEMNLP2025Link
Tracing Multilingual Factual Knowledge Acquisition in PretrainingResidual StreamVocab ProjectionVector ArithmeticEMNLP2025Link

Knowledge Management

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Fine-tuning Done Right in Model EditingFFNGradient DetectionTargeted OptimizationICLR2026Link
ACE: Attribution-Controlled Knowledge Editing for Multi-hop Factual RecallFFNCausal AttributionTargeted OptimizationICLR2026Link
LoKI: Low-damage Knowledge Implanting of Large Language ModelsFFNCausal AttributionTargeted OptimizationAAAI2026Link
Locating and Editing Factual Associations in GPTFFNCausal AttributionTargeted OptimizationNeurIPS2022Link
Mass-Editing Memory in a TransformerFFNCausal AttributionTargeted OptimizationICLR2023Link
Joint Localization and Activation Editing for Low-Resource Fine-TuningMHAMagnitude AnalysisTargeted OptimizationICML2025Link
Taming Knowledge Conflicts in Language ModelsMHAMagnitude AnalysisAmplitude ManipulationICML2025Link
Massive Values in Self-Attention Modules are the Key to Contextual Knowledge UnderstandingMHAMagnitude AnalysisAmplitude ManipulationICML2025Link
Cutting Off the Head Ends the Conflict: A Mechanism for Interpreting and Mitigating Knowledge Conflicts in Language ModelsMHACausal AttributionAmplitude ManipulationACL2024Link
Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language ModelsMHACausal AttributionAmplitude ManipulationArXiv2024Link
Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMsMHACausal AttributionAmplitude ManipulationACL2025Link
Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented GenerationMHAMagnitude AnalysisAmplitude ManipulationICLR2026Link
Probing and Boosting Large Language Models Capabilities via Attention HeadsMHAProbingTargeted OptimizationEMNLP2025Link
TIES-Merging: Resolving Interference When Merging ModelsMHA & FFNMagnitude AnalysisVector ArithmeticNeurIPS2023Link
Neuron-Level Knowledge Attribution in Large Language ModelsMHA & FFNMagnitude AnalysisAmplitude ManipulationEMNLP2024Link
Balancing Speciality and Versatility: a Coarse to Fine Framework for Supervised Fine-tuning Large Language ModelMHA & FFNMagnitude AnalysisTargeted OptimizationACL2024Link
Knowledge Localization: Mission Not Accomplished? Enter Query Localization!MHA & FFNMagnitude AnalysisAmplitude ManipulationICLR2025Link
Enhancing Large Language Model Performance with Gradient-Based Parameter SelectionMHA & FFNMagnitude AnalysisTargeted OptimizationAAAI2025Link
The Geometry of Forgetting: Analyzing Machine Unlearning through Local Learning CoefficientsMHA & FFNMagnitude Analysis-ICML2025Link
Knowledge Circuits in Pretrained TransformersMHA & FFNCircuit Discovery-NeurIPS2024Link
Towards Secure Tuning: Mitigating Security Risks Arising from Benign Instruction Fine-TuningMHA & FFNProbingTargeted OptimizationArXiv2024Link
Unveiling Linguistic Regions in Large Language ModelsMHA & FFNGradient DetectionTargeted OptimizationACL2024Link
Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language ModelsMHA & FFNGradient DetectionVector ArithmeticACL2025Link
Activation-Guided Consensus Merging for Large Language ModelsMHA & FFNMagnitude AnalysisVector ArithmeticNeurIPS2025Link
Dissecting Recall of Factual Associations in Auto-Regressive Language ModelsMHA & FFNCausal Attribution-EMNLP2023Link
Multilingual Knowledge Editing with Language-Agnostic Factual NeuronsNeuronMagnitude AnalysisTargeted OptimizationCOLING2025Link
Journey to the Center of the Knowledge Neurons: Discoveries of Language-Independent Knowledge Neurons and Degenerate Knowledge NeuronsNeuronGradient DetectionAmplitude ManipulationAAAI2024Link
IRCAN: Mitigating Knowledge Conflicts in LLM Generation via Identifying and Reweighting Context-Aware NeuronsNeuronGradient DetectionAmplitude ManipulationNeurIPS2024Link
Identifying Query-Relevant Neurons in Large Language Models for Long-Form TextsNeuronGradient DetectionAmplitude ManipulationAAAI2025Link
Reviving Your MNEME: Predicting The Side Effects of LLM Unlearning and Fine-Tuning via Sparse Model DiffingNeuron-Amplitude ManipulationEMNLP2025Link
Steering Knowledge Selection Behaviours in LLMs via SAE-Based Representation EngineeringSAE FeatureMagnitude AnalysisAmplitude ManipulationNAACL2025Link
SAEs Can Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMsSAE FeatureMagnitude AnalysisAmplitude ManipulationICML2025Link
Breaking Bad Tokens: Detoxification of LLMs Using Sparse AutoencodersSAE FeatureMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language ModelsSAE FeatureCircuit DiscoveryAmplitude ManipulationICLR2025Link
Impact of Co-occurrence on Factual Knowledge of Large Language ModelsResidual StreamProbing-EMNLP2023Link
Backward Lens: Projecting Language Model Gradients into the Vocabulary SpaceResidual StreamVocab ProjectionTargeted OptimizationEMNLP2024Link
ReFT: Representation Finetuning for Language ModelsResidual StreamCausal AttributionTargeted OptimizationNeurIPS2024Link
Analysing the Residual Stream of Language Models Under Knowledge ConflictsResidual StreamProbing-ArXiv2024Link
How Large Language Models Encode Context Knowledge? A Layer-Wise Probing StudyResidual StreamProbing-COLING2024Link
Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers?Residual StreamProbing-COLING2025Link
Transferring Linear Features Across Language Models With Model StitchingResidual StreamProbingVector ArithmeticNeurIPS2025Link

3. Improve Efficiency

Efficient Training

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Task-Specific Skill Localization in Fine-tuned Language ModelsNeuronMagnitude AnalysisTargeted OptimizationICML2023Link
LANDeRMT: Dectecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine TranslationNeuronGradient DetectionTargeted OptimizationACL2024Link
Sparse is enough in fine-tuning pre-trained large language modelsNeuronGradient DetectionTargeted OptimizationICML2024Link
Fine-tuning Happens in Tiny Subspaces: Exploring Intrinsic Task-specific Subspaces of Pre-trained Language ModelsNeuronMagnitude AnalysisTargeted OptimizationACL2023Link
Let's Focus on Neuron: Neuron-Level Supervised Fine-tuning for Large Language ModelNeuronMagnitude AnalysisTargeted OptimizationCOLING2025Link
Language-Specific Neurons Do Not Facilitate Cross-Lingual TransferNeuronMagnitude AnalysisTargeted OptimizationACL2025Link
Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language ModelsNeuronMagnitude AnalysisTargeted OptimizationAACL2025Link
How do Large Language Models Handle Multilingualism?NeuronCausal AttributionTargeted OptimizationNeurIPS2024Link
Optimizing Multimodal Language Models through Attention-based InterpretabilityMHAMagnitude AnalysisTargeted OptimizationICAI2025Link
In-context Learning and Induction HeadsMHAMagnitude Analysis-ArXiv2022Link
How Transformers Implement Induction Heads: Approximation and Optimization AnalysisMHAMagnitude Analysis-ArXiv2024Link
What needs to go right for an induction head? a mechanistic study of in-context learning circuits and their formationMHAMagnitude Analysis-ICML2024Link
The developmental landscape of in-context learningMHAMagnitude Analysis-TLMR2025Link
In-Context Meta Learning Induces Multi-Phase Circuit EmergenceMHAMagnitude Analysis-ICLR2025Link
Joint Localization and Activation Editing for Low-Resource Fine-TuningMHAMagnitude AnalysisVector ArithmeticICML2025Link
The slingshot mechanism: An empirical study of adaptive optimizers and the Grokking PhenomenonMHA & FFNMagnitude Analysis-NeurIPS2022Link
Explaining grokking through circuit efficiencyMHA & FFNMagnitude Analysis-ArXiv2023Link
Towards Empirical Interpretation of Internal Circuits and Properties in Grokked Transformers on Modular PolynomialsMHA & FFNMagnitude Analysis-TMLR2024Link
Progress measures for grokking via mechanistic interpretabilityMHA & FFNMagnitude Analysis-ICLR2023Link
Predicting grokking long before it happens: A look into the loss landscape of models which grokMHA & FFNMagnitude Analysis-ArXiv2023Link
Exploring Grokking: Experimental and Mechanistic InvestigationsMHA & FFNMagnitude Analysis-ArXiv2024Link
Omnigrok: Grokking Beyond Algorithmic DataMHA & FFNMagnitude Analysis-ICLR2023Link
Where to find Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without TestMHA & FFNMagnitude Analysis-ArXiv2025Link
Grokking of implicit reasoning in transformers: A mechanistic journey to the edge of generalizationMHA & FFNMagnitude Analysis-NeurIPS2024Link
Unified View of Grokking, Double Descent and Emergent Abilities: A Comprehensive Study on Algorithm TaskMHA & FFNMagnitude Analysis-COLM2024Link
Fine-Tuning is Subgraph Search: A New Lens on Learning DynamicsMHA & FFNCircuit DiscoveryTargeted OptimizationArXiv2025Link
Constructive Circuit Amplification:Improving Math Reasoning in LLMS via Targeted Sub-Network UpdatesMHA & FFNCircuit DiscoveryTargeted OptimizationArXiv2025Link

Efficient Inference

PaperObjectLocalizing MethodSteering MethodVenueYearLink
TokenSkip: Controllable Chain-of-Thought Compression in LLMsToken EmbeddingMagitude AnalysisAmplitude ManipulationEMNLP2025Link
Generic Token Compression in Multimodal Large Language Models from an Explainability PerspectiveToken EmbeddingGradient DetectionAmplitude ManipulationArXiv2025Link
Attention Score is not All You Need for Token Importance Indicator in KV Cache Reduction: Value Also MattersToken EmbeddingMagnitude AnalysisAmplitude ManipulationEMNLP2024Link
Fit and prune: Fast and training-free visual token pruning for multi-modal large language modelsToken EmbeddingMagnitude AnalysisAmplitude ManipulationAAAI2025Link
Zipcache: Accurate and efficient kv cache quantization with salient token identificationToken EmbeddingMagnitude AnalysisAmplitude ManipulationNeurIPS2024Link
Pyramidkv: Dynamic kv cache compression based on pyramidal information funnelingToken EmbeddingMagnitude AnalysisAmplitude ManipulationCOLM2025Link
What Layers When: Learning to Skip Compute in LLMs with Residual GatesResidual StreamMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Accelerating Large Language Model Inference with Self-Supervised Early ExitsResidual StreamProbingAmplitude ManipulationArXiv2024Link
LayerSkip: Enabling Early Exit Inference and Self-Speculative DecodingResidual StreamProbingAmplitude ManipulationACL2024Link
HadSkip: Homotopic and Adaptive Layer Skipping of Pre-trained Language Models for Efficient InferenceResidual StreamMagnitude AnalysisAmplitude ManipulationEMNLP2023Link
Learning to Skip the Middle Layers of TransformersResidual StreamMagnitude AnalysisAmplitude ManipulationArXiv2025Link
ShortGPT: Layers in Large Language Models are More Redundant Than You ExpectResidual StreamMagnitude AnalysisAmplitude ManipulationACL2025Link
Layer-wise quantization: A pragmatic and effective method for quantizing llms beyond integer bit-levelsResidual StreamMagnitude Analysis-ArXiv2024Link
Towards Superior Quantization Accuracy: A Layer-sensitive ApproachResidual StreamMagnitude Analysis-ArXiv2025Link
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language ModelsResidual StreamMagnitude Analysis-ArXiv2025Link
Mix-QViT: Mixed-precision vision transformer quantization driven by layer importance and quantization sensitivityResidual StreamGradient Detection-ArXiv2025Link
Lsaq: Layer-specific adaptive quantization for large language model deploymentResidual StreamVocab Projection-ArXiv2024Link
Towards Building Efficient Sentence BERT Models using Layer PruningResidual StreamCausal AttributionAmplitude ManipulationACL2024Link
KVSink: Understanding and Enhancing the Preservation of Attention Sinks in KV Cache Quantization for LLMsMHA & FFNCircuit Discovery-COLM2025Link
Beyond Outliers: A Data-Free Layer-wise Mixed-Precision Quantization Approach Driven by Numerical and Structural Dual-SensitivityMHA & FFNMagnitude Analysis-ArXiv2026Link
Massive activations in large language modelsMHA & FFNMagnitude Analysis-NeurIPS2024Link
Systematic outliers in large language modelsMHA & FFNCircuit Discovery-ICLR2025Link
Quantizable Transformers: Removing Outliers by Helping Attention Heads Do NothingMHA & FFNCircuit Discovery-NeurIPS2023Link
RazorAttention: Efficient kv cache compression through retrieval headsMHACircuit DiscoveryAmplitude ManipulationICLR2025Link
DuoAttention: Efficient long-context llm inference with retrieval and streaming headsMHACircuit DiscoveryAmplitude ManipulationICLR2025Link
Unveiling visual perception in language models: An Attention head analysis approachMHAMagnitude Analysis-CVPR2025Link
Fast and Low-Cost Genomic Foundation Models via Outlier RemovalMHAMagnitude AnalysisAmplitude ManipulationICML2025Link
FROST: Filtering Reasoning Outliers with Attention for Efficient ReasoningMHAMagnitude AnalysisAmplitude ManipulationICLR2026Link
Rotatekv: Accurate and robust 2-bit kv cache quantization for llms via outlier-aware adaptive rotationsMHAMagnitude AnalysisAmplitude ManipulationIJCAI2025Link
Efficient Streaming Language Models with Attention SinksMHAMagnitude AnalysisAmplitude ManipulationICLR2024Link
Unraveling babel: Exploring multilingual activation patterns within large language modelsNeuronMagnitude AnalysisAmplitude ManipulationArXiv2024Link
Neuron Specialization: Leveraging Intrinsic Task Modularity for Multilingual Machine TranslationNeuronMagnitude Analysis-EMNLP2024Link
The super weight in large language modelsFFNMagnitude AnalysisAmplitude ManipulationArxiv2024Link
Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language modelsFFNMagnitude AnalysisAmplitude ManipulationACL2024Link
Unveiling super experts in mixture-of-experts large language modelsFFNMagnitude AnalysisAmplitude ManipulationArXiv2025Link

🌟 Citation

If you find this survey or repository useful for your research, please cite:

@article{zhang2026locate,
  title={Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models},
  author={Zhang, Hengyuan and Zhang, Zhihao and Wang, Mingyang and Su, Zunhai and Wang, Yiwei and Wang, Qianli and Yuan, Shuzhou and Nie, Ercong and Duan, Xufeng and Xue, Qibo and others},
  journal={arXiv preprint arXiv:2601.14004},
  year={2026}
}

πŸ“§ Contact

Feel free to open an issue or contact us if you have any questions or want to include your work in this list!

Corresponding Author: Hengyuan Zhang (hengyuan.zhang88@gmail.com) and Zhihao Zhang (zhihaozhang017@gmail.com)

Contributors

rattlesnakey

15 commits

zzhang0179

2 commits

qiaw99

1 commits

ShuzhouYuan

1 commits

rattlesnakey/Awesome-Actionable-MI-Survey

The Github repo for our survey paper: "Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models"

157

20 commits

updated Apr 15, 2026

See the code

README

πŸ”Ž Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models

PDF Status arXiv

Awesome GitHub stars

We will continue to update this repository.

If you enjoy or benefit from the project, a star ⭐ on GitHub would be greatly appreciated and will help you stay informed about future updates.

πŸ“– Table of Contents

πŸ“– Overview

A systematic survey on how to locate interpretable objects, steer model behaviors, and improve LLMs (Alignment, Capability, Efficiency) via Mechanistic Interpretability.

Overview Figure

Note: The figure illustrates our framework: Locate (Identifying internal objects), Steer (Manipulating behaviors), and Improve (Downstream applications).

Mechanistic Interpretability (MI) has evolved from merely observing model internals to actively intervening in them. This repository maintains a curated list of papers reviewed in our survey, focusing on Actionable MI.

πŸ”₯ Latest News

  • [2026-03-28] We have significantly updated our paper list with 18 new papers! These additions cover the latest advancements in reasoning steering, knowledge editing, efficient inference, and more. πŸš€
  • [2026-1-21] Our paper is available on arXiv! Check it out here.
  • [2026-1-20] This repository is created to track the latest progress in Actionable MI.

🏷 Taxonomy & Legends

To help navigate the paper list, we use the following abbreviations for Objects, Localizing Methods, and Steering Methods:

Interpretable Objects

The core interpretable objects in our survey are shown below:

Localizing Methods (How to find it?)

  • Magnitude Analysis: Weights or activation magnitude analysis, training-free but data-dependent
  • Causal Attribution: Patching and ablation
  • Gradient Detection: Data-dependent and incurs extra compute
  • Probing: Supervised property decoding
  • Vocab Projection: Logit Lens, direct semantic mapping
  • Circuit Discovery: Causal subnetwork identification

Steering Methods (How to control it?)

  • Amplitude Manipulation: Scaling and replace
  • Targeted Optimization: Weight editing, targeted fine-tuning
  • Vector Arithmetic: Steering via feature and task vectors

πŸ“‘ Paper List

For studies employing multiple objects or localizing/steering methods, we annotate the primary tag.

1. Improve Alignment

Safety and Reliability

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Safety Layers in Aligned Large Language Models: The Key to LLM SecurityResidual StreamCausal AttributionTargeted OptimizationICLR2025Link
Refusal in Language Models Is Mediated by a Single DirectionResidual StreamCausal AttributionVector ArithmeticNeurIPS2024Link
LLMs Encode Harmfulness and Refusal SeparatelyResidual StreamCausal AttributionVector ArithmeticNeurIPS2025Link
To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language ModelsResidual StreamProbingVector ArithmeticICML2025Link
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?Residual StreamProbingVector ArithmeticArXiv2025Link
Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMsResidual StreamVocab ProjectionAmplitude ManipulationArXiv2026Link
A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and ToxicityResidual StreamProbingTargeted OptimizationICML2024Link
Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language ModelsResidual StreamCausal AttributionVector ArithmeticArXiv2024Link
Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector AblationResidual StreamCausal AttributionVector ArithmeticICLR2025Link
Refusal Direction is Universal Across Safety-Aligned LanguagesResidual StreamCausal AttributionVector ArithmeticNeurIPS2025Link
Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in ExplanationsResidual StreamCausal AttributionVector ArithmeticICML2025Link
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution BehaviorsResidual StreamCausal AttributionVector ArithmeticICML2025Link
The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety DirectionsResidual StreamCausal AttributionVector ArithmeticICML2025Link
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language ModelsResidual StreamVocab ProjectionVector ArithmeticICLR2024Link
In-Context Sharpness as Alerts: An Inner Representation Perspective for Hallucination MitigationResidual StreamVocab ProjectionVector ArithmeticICML2024Link
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful SpaceResidual StreamProbingVector ArithmeticACL2024Link
LLMs Know More Than They Show: On the Intrinsic Representation of LLM HallucinationsResidual StreamProbingVector ArithmeticICLR2025Link
Multi-Attribute Steering of Language Models via Targeted InterventionResidual StreamGradient DetectionVector ArithmeticACL2025Link
Improving Instruction-Following in Language Models through Activation SteeringResidual Stream-Vector ArithmeticICLR2025Link
On the Role of Attention Heads in Large Language Model SafetyMHACausal AttributionAmplitude ManipulationICLR2025Link
Refine Large Language Model Fine-tuning via Instruction VectorMHACausal AttributionTargeted OptimizationArXiv2024Link
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety NeuronsNeuronCausal AttributionAmplitude ManipulationArXiv2025Link
Whispering Experts: Neural Interventions for Toxicity Mitigation in Language ModelsNeuronMagnitude AnalysisAmplitude ManipulationICML2024Link
H-Neurons: On the Existence, Impact, and Origin of Hallucination-Associated Neurons in LLMsNeuronMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Understanding and Enhancing Safety Mechanisms of LLMs via Safety-Specific NeuronNeuronMagnitude AnalysisTargeted OptimizationICLR2025Link
Neuron-Aware Data Selection in Instruction Tuning for Large Language ModelsNeuronMagnitude Analysis-ICLR2026Link
Precision Knowledge Editing: Enhancing Safety in Large Language ModelsNeuronMagnitude AnalysisTargeted OptimizationArXiv2025Link
Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 SonnetSAE FeatureMagnitude AnalysisAmplitude ManipulationBlog2024Link
Breaking Bad Tokens: Detoxification of LLMs Using Sparse AutoencodersSAE FeatureMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
Understanding Refusal in Language Models with Sparse AutoencodersSAE FeatureMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation FrameworkSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse AutoencodersSAE FeatureMagnitude AnalysisVector ArithmeticICML2025Link
Saif: A sparse autoencoder framework for interpreting and steering instruction following of language modelsSAE FeatureMagnitude AnalysisVector ArithmeticArXiv2025Link
Training Superior Sparse Autoencoders for Instruct ModelsSAE FeatureMagnitude AnalysisVector ArithmeticArXiv2025Link
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM UnitsSAE FeatureGradient Detection-ArXiv2026Link
Towards Secure Tuning: Mitigating Security Risks Arising from Benign Instruction Fine-TuningToken EmbeddingGradient DetectionVector ArithmeticArXiv2025Link
Pierce the Mists, Greet the Sky: Decipher Knowledge Overshadowing via Knowledge Circuit AnalysisMHA & FFNCircuit DiscoveryTargeted OptimizationEMNLP2025Link
On Localizing and Deleting Toxic Memories in Large Language ModelsFFNCausal AttributionTargeted OptimizationNAACL2025Link

Fairness and Bias

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Entangled in Representations: Mechanistic Investigation of Cultural Biases in Large Language ModelsResidual StreamCausal Attribution-ArXiv2025Link
MPF: Aligning and Debiasing Language Models Post Deployment via Multi Perspective FusionResidual Stream-Amplitude ManipulationICML2025Link
Mitigate Position Bias in LLMs via Scaling a Single Hidden States ChannelResidual StreamMagnitude AnalysisAmplitude ManipulationACL2025Link
Analysing Moral Bias in Finetuned LLMs through Mechanistic InterpretabilityResidual StreamCausal AttributionAmplitude ManipulationArXiv2025Link
Investigating Gender Bias in Language Models Using Causal Mediation AnalysisMHACausal AttributionAmplitude ManipulationNeurIPS2020Link
Dissecting Bias in LLMs: A Mechanistic Interpretability PerspectiveMHAMagnitude AnalysisAmplitude ManipulationTMLR2025Link
Linear Representations of Political Perspective Emerge in Large Language ModelsMHAProbingVector ArithmeticICLR2025Link
Tracing Positional Bias in Financial Decision-Making: Mechanistic Insights from Qwen2.5MHAMagnitude Analysis-ICAIF2025Link
Eliminating Position Bias of Language Models: A Mechanistic ApproachMHAMagnitude AnalysisAmplitude ManipulationICLR2025Link
Identifying and Adapting Transformer-Components Responsible for Gender Bias in an English Language ModelMHACausal AttributionTargeted OptimizationACLWS2023Link
Locating and Mitigating Gender Bias in Large Language ModelsFFNCausal AttributionTargeted OptimizationICIC2024Link
Elucidating Mechanisms of Demographic Bias in LLMs for HealthcareFFNCausal AttributionAmplitude ManipulationEMNLP2025Link
Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice QuestionsFFNVocab ProjectionTargeted OptimizationACL2025Link
Understanding and Mitigating Gender Bias in LLMs via Interpretable Neuron EditingNeuronCircuit DiscoveryTargeted OptimizationArXiv2025Link
The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language ModelsNeuronGradient DetectionAmplitude ManipulationICLR2024Link

Persona and Role

PaperObjectLocalizing MethodSteering MethodVenueYearLink
The Assistant Axis: Situating and Stabilizing the Default Persona of Language ModelsResidual StreamMagnitude AnalysisVector ArithmeticArXiv2026Link
Can Role Vectors Affect LLM Behaviour?Residual StreamCausal AttributionVector ArithmeticEMNLP2025Link
Persona vectors: Monitoring and controlling character traits in language modelsResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
From Monolingual to Bilingual: Investigating Language Conditioning in Large Language Models for Psycholinguistic TasksResidual StreamProbing-AACL2025Link
Mechanistic Interpretability of Emotion Inference in Large Language ModelsResidual StreamProbingVector ArithmeticACL2025Link
Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream EffectsResidual StreamCausal AttributionVector ArithmeticNeurIPS2025Link
Steering Llama 2 via Contrastive Activation AdditionResidual StreamCausal AttributionVector ArithmeticACL2024Link
Probing then Editing Response Personality of Large Language ModelsResidual StreamProbingTargeted OptimizationCOLM2025Link
Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AIResidual StreamCausal Attribution-ArXiv2025Link
From Rational Answers to Emotional Resonance: The Role of Controllable Emotion Generation in Language ModelsResidual Stream-Vector ArithmeticArXiv2025Link
Psychological Steering in LLMs: An Evaluation of Effectiveness and TrustworthinessResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
Steering Latent Traits, Not Learned Facts: An Empirical Study of Activation Control LimitsResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
Personality Vector: Modulating Personality of Large Language Models by Model MergingResidual StreamCausal AttributionVector ArithmeticEMNLP2025Link
Billy: Steering large language models via merging persona vectors for creative generationResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
Personas as a way to model truthfulness in language modelsResidual StreamProbing-EMNLP2024Link
Who's asking? User personas and the mechanics of latent misalignmentResidual StreamCausal AttributionVector ArithmeticNeurIPS2024Link
Understanding How Value Neurons Shape the Generation of Specified Values in LLMsNeuronCausal AttributionAmplitude ManipulationEMNLP2025Link
Neuron based Personality Trait Induction in Large Language ModelsNeuronCausal AttributionAmplitude ManipulationICLR2025Link
From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint TuningNeuronCausal AttributionTargeted OptimizationICML2024Link

2. Improve Capability

Logic and Reasoning

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Reasoning-Finetuning Repurposes Latent Representations in Base ModelsResidual StreamCausal AttributionVector ArithmeticICML2025Link
Improving Reasoning Performance in Large Language Models via Representation EngineeringResidual StreamCausal AttributionVector ArithmeticICLR2025Link
Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal PoliciesResidual StreamVocab ProjectionTargeted OptimizationArXiv2025Link
Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation EngineeringResidual StreamCausal AttributionVector ArithmeticACL2025Link
Probing for Arithmetic Errors in Language ModelsResidual StreamProbing-EMNLP2025Link
Eliciting Chain-of-Thought in Base LLMs via Gradient-Based Representation OptimizationResidual StreamProbingVector ArithmeticAAAI2026Link
Understanding Reasoning in Thinking Language Models via Steering VectorsResidual StreamCausal AttributionVector ArithmeticICLR2025Link
Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop QueriesResidual StreamProbing-EMNLP2024Link
Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning ProcessResidual StreamProbing-ICLR2025Link
The Reasoning-Memorization Interplay in Language Models Is Mediated by a Single DirectionResidual StreamCausal AttributionVector ArithmeticACL2025Link
Uncovering Latent Chain of Thought Vectors in Language ModelsResidual StreamCausal AttributionVector ArithmeticICLR2025Link
Fractional Reasoning via Latent Steering Vectors Improves Inference Time ComputeResidual StreamCausal AttributionVector ArithmeticArXiv2025Link
Steering LLM Reasoning Through Bias-Only AdaptationResidual StreamCausal AttributionVector ArithmeticEMNLP2025Link
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language ModelsResidual StreamCausal AttributionVector ArithmeticEMNLP2025Link
ATLAS: Adaptive Test-Time Latent Steering with External Verifiers for Enhancing LLMs' ReasoningResidual StreamProbingVector ArithmeticArXiv2026Link
Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-TimeMHAProbingAmplitude ManipulationArXiv2025Link
How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric LearningMHAMagnitude AnalysisAmplitude ManipulationEMNLP2024Link
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron AnalysisMHACausal AttributionAmplitude ManipulationEMNLP2024Link
Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language ModelsMHACausal Attribution-EMNLP2025Link
Chain-of-Thought in Large Language Models: Decoding, Projection, and ActivationMHA & FFNMagnitude Analysis-ArXiv2024Link
Interpreting and Improving Large Language Models in Arithmetic CalculationMHA & FFNCausal AttributionTargeted OptimizationICML2024Link
A Mechanistic Interpretation of Arithmetic Reasoning in Language Models using Causal Mediation AnalysisMHA & FFNCausal Attribution-EMNLP2023Link
Uncovering the Interpretation of Large Language ModelsMHA & FFNCausal Attribution-COMPSAC2024Link
Understanding Addition in TransformersMHA & FFNCausal AttributionAmplitude ManipulationICLR2024Link
Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal ThinkingMHA & FFNGradient DetectionTargeted OptimizationACL2025Link
How does GPT-2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language modelMHA & FFNCircuit Discovery-NeurIPS2023Link
Arithmetic Without Algorithms: Language Models Solve Math with a Bag of HeuristicsMHA & FFNCircuit Discovery-ICLR2025Link
Sparse Autoencoders Learn Monosemantic Features in Vision-Language ModelsSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Fantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning ProcessSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Reasoning Models Generate Societies of ThoughtSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2026Link
I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse AutoencodersSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Internal states before wait modulate reasoning patternsSAE FeatureMagnitude AnalysisVector ArithmeticEMNLP2025Link
Can we interpret latent reasoning using current mechanistic interpretability tools?Token EmbeddingCausal AttributionAmplitude ManipulationBlog2025Link
Analyzing chain-of-thought prompting in large language models via gradient-based feature attributionsToken EmbeddingGradient Detection-ICML2023Link
Probabilistic Soundness Guarantees in LLM Reasoning ChainsToken EmbeddingMagnitude Analysis-EMNLP2025Link
Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional TrainingFFNMagnitude AnalysisAmplitude ManipulationArXiv2025Link

Multilingualism

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Importance-based Neuron Allocation for Multilingual Neural Machine TranslationNeuronMagnitude AnalysisAmplitude ManipulationACL2021Link
On the Multilingual Ability of Decoder-based Pre-trained Language Models: Finding and Controlling Language-Specific NeuronsNeuronMagnitude AnalysisAmplitude ManipulationNAACL2024Link
Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language ModelsNeuronMagnitude AnalysisAmplitude ManipulationACL2024Link
How do Large Language Models Handle Multilingualism?NeuronMagnitude AnalysisAmplitude ManipulationNeurIPS2024Link
Language Arithmetics: Towards Systematic Language Neuron Identification and ManipulationNeuronMagnitude AnalysisAmplitude ManipulationArXiv2025Link
On Relation-Specific Neurons in Large Language ModelsNeuronMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-EncoderNeuronMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
Sparse Autoencoders Can Capture Language-Specific Concepts Across Diverse LanguagesSAE FeatureMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse LanguagesSAE FeatureMagnitude AnalysisAmplitude ManipulationNAACL2025Link
On the Language Neutrality of Pre-trained Multilingual RepresentationsResidual StreamProbing-EMNLP2020Link
Can Cross-Lingual Transferability of Multilingual Transformers Be Activated Without End-Task Data?Residual Stream-Vector ArithmeticACL2023Link
Identifying the Correlation Between Language Distance and Cross-Lingual Transfer in a Multilingual Representation SpaceResidual StreamMagnitude AnalysisVector ArithmeticACL2023Link
Do Llamas Work in English? On the Latent Language of Multilingual TransformersResidual StreamVocab ProjectionVector ArithmeticACL2024Link
Exploring Alignment in Shared Cross-lingual SpacesResidual StreamMagnitude AnalysisVector ArithmeticACL2024Link
Why do LLaVA Vision-Language Models Reply to Images in English?Residual StreamProbingVector ArithmeticEMNLP2024Link
ShifCon: Enhancing Non-Dominant Language Capabilities with a Shift-based Multilingual Contrastive FrameworkResidual StreamMagnitude AnalysisVector ArithmeticACL2025Link
Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language ModelsResidual StreamVocab ProjectionVector ArithmeticACL2025Link
The Semantic Hub Hypothesis: Language Models Share Semantic Representations Across Languages and ModalitiesResidual StreamVocab Projection-ICLR2025Link
Language Mixing in Reasoning Language Models: Patterns, Impact, and Internal CausesResidual StreamVocab ProjectionVector ArithmeticEMNLP2025Link
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language ModelsResidual StreamVocab ProjectionVector ArithmeticEMNLP2025Link
Tracing Multilingual Factual Knowledge Acquisition in PretrainingResidual StreamVocab ProjectionVector ArithmeticEMNLP2025Link

Knowledge Management

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Fine-tuning Done Right in Model EditingFFNGradient DetectionTargeted OptimizationICLR2026Link
ACE: Attribution-Controlled Knowledge Editing for Multi-hop Factual RecallFFNCausal AttributionTargeted OptimizationICLR2026Link
LoKI: Low-damage Knowledge Implanting of Large Language ModelsFFNCausal AttributionTargeted OptimizationAAAI2026Link
Locating and Editing Factual Associations in GPTFFNCausal AttributionTargeted OptimizationNeurIPS2022Link
Mass-Editing Memory in a TransformerFFNCausal AttributionTargeted OptimizationICLR2023Link
Joint Localization and Activation Editing for Low-Resource Fine-TuningMHAMagnitude AnalysisTargeted OptimizationICML2025Link
Taming Knowledge Conflicts in Language ModelsMHAMagnitude AnalysisAmplitude ManipulationICML2025Link
Massive Values in Self-Attention Modules are the Key to Contextual Knowledge UnderstandingMHAMagnitude AnalysisAmplitude ManipulationICML2025Link
Cutting Off the Head Ends the Conflict: A Mechanism for Interpreting and Mitigating Knowledge Conflicts in Language ModelsMHACausal AttributionAmplitude ManipulationACL2024Link
Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language ModelsMHACausal AttributionAmplitude ManipulationArXiv2024Link
Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMsMHACausal AttributionAmplitude ManipulationACL2025Link
Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented GenerationMHAMagnitude AnalysisAmplitude ManipulationICLR2026Link
Probing and Boosting Large Language Models Capabilities via Attention HeadsMHAProbingTargeted OptimizationEMNLP2025Link
TIES-Merging: Resolving Interference When Merging ModelsMHA & FFNMagnitude AnalysisVector ArithmeticNeurIPS2023Link
Neuron-Level Knowledge Attribution in Large Language ModelsMHA & FFNMagnitude AnalysisAmplitude ManipulationEMNLP2024Link
Balancing Speciality and Versatility: a Coarse to Fine Framework for Supervised Fine-tuning Large Language ModelMHA & FFNMagnitude AnalysisTargeted OptimizationACL2024Link
Knowledge Localization: Mission Not Accomplished? Enter Query Localization!MHA & FFNMagnitude AnalysisAmplitude ManipulationICLR2025Link
Enhancing Large Language Model Performance with Gradient-Based Parameter SelectionMHA & FFNMagnitude AnalysisTargeted OptimizationAAAI2025Link
The Geometry of Forgetting: Analyzing Machine Unlearning through Local Learning CoefficientsMHA & FFNMagnitude Analysis-ICML2025Link
Knowledge Circuits in Pretrained TransformersMHA & FFNCircuit Discovery-NeurIPS2024Link
Towards Secure Tuning: Mitigating Security Risks Arising from Benign Instruction Fine-TuningMHA & FFNProbingTargeted OptimizationArXiv2024Link
Unveiling Linguistic Regions in Large Language ModelsMHA & FFNGradient DetectionTargeted OptimizationACL2024Link
Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language ModelsMHA & FFNGradient DetectionVector ArithmeticACL2025Link
Activation-Guided Consensus Merging for Large Language ModelsMHA & FFNMagnitude AnalysisVector ArithmeticNeurIPS2025Link
Dissecting Recall of Factual Associations in Auto-Regressive Language ModelsMHA & FFNCausal Attribution-EMNLP2023Link
Multilingual Knowledge Editing with Language-Agnostic Factual NeuronsNeuronMagnitude AnalysisTargeted OptimizationCOLING2025Link
Journey to the Center of the Knowledge Neurons: Discoveries of Language-Independent Knowledge Neurons and Degenerate Knowledge NeuronsNeuronGradient DetectionAmplitude ManipulationAAAI2024Link
IRCAN: Mitigating Knowledge Conflicts in LLM Generation via Identifying and Reweighting Context-Aware NeuronsNeuronGradient DetectionAmplitude ManipulationNeurIPS2024Link
Identifying Query-Relevant Neurons in Large Language Models for Long-Form TextsNeuronGradient DetectionAmplitude ManipulationAAAI2025Link
Reviving Your MNEME: Predicting The Side Effects of LLM Unlearning and Fine-Tuning via Sparse Model DiffingNeuron-Amplitude ManipulationEMNLP2025Link
Steering Knowledge Selection Behaviours in LLMs via SAE-Based Representation EngineeringSAE FeatureMagnitude AnalysisAmplitude ManipulationNAACL2025Link
SAEs Can Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMsSAE FeatureMagnitude AnalysisAmplitude ManipulationICML2025Link
Breaking Bad Tokens: Detoxification of LLMs Using Sparse AutoencodersSAE FeatureMagnitude AnalysisAmplitude ManipulationEMNLP2025Link
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language ModelsSAE FeatureCircuit DiscoveryAmplitude ManipulationICLR2025Link
Impact of Co-occurrence on Factual Knowledge of Large Language ModelsResidual StreamProbing-EMNLP2023Link
Backward Lens: Projecting Language Model Gradients into the Vocabulary SpaceResidual StreamVocab ProjectionTargeted OptimizationEMNLP2024Link
ReFT: Representation Finetuning for Language ModelsResidual StreamCausal AttributionTargeted OptimizationNeurIPS2024Link
Analysing the Residual Stream of Language Models Under Knowledge ConflictsResidual StreamProbing-ArXiv2024Link
How Large Language Models Encode Context Knowledge? A Layer-Wise Probing StudyResidual StreamProbing-COLING2024Link
Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers?Residual StreamProbing-COLING2025Link
Transferring Linear Features Across Language Models With Model StitchingResidual StreamProbingVector ArithmeticNeurIPS2025Link

3. Improve Efficiency

Efficient Training

PaperObjectLocalizing MethodSteering MethodVenueYearLink
Task-Specific Skill Localization in Fine-tuned Language ModelsNeuronMagnitude AnalysisTargeted OptimizationICML2023Link
LANDeRMT: Dectecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine TranslationNeuronGradient DetectionTargeted OptimizationACL2024Link
Sparse is enough in fine-tuning pre-trained large language modelsNeuronGradient DetectionTargeted OptimizationICML2024Link
Fine-tuning Happens in Tiny Subspaces: Exploring Intrinsic Task-specific Subspaces of Pre-trained Language ModelsNeuronMagnitude AnalysisTargeted OptimizationACL2023Link
Let's Focus on Neuron: Neuron-Level Supervised Fine-tuning for Large Language ModelNeuronMagnitude AnalysisTargeted OptimizationCOLING2025Link
Language-Specific Neurons Do Not Facilitate Cross-Lingual TransferNeuronMagnitude AnalysisTargeted OptimizationACL2025Link
Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language ModelsNeuronMagnitude AnalysisTargeted OptimizationAACL2025Link
How do Large Language Models Handle Multilingualism?NeuronCausal AttributionTargeted OptimizationNeurIPS2024Link
Optimizing Multimodal Language Models through Attention-based InterpretabilityMHAMagnitude AnalysisTargeted OptimizationICAI2025Link
In-context Learning and Induction HeadsMHAMagnitude Analysis-ArXiv2022Link
How Transformers Implement Induction Heads: Approximation and Optimization AnalysisMHAMagnitude Analysis-ArXiv2024Link
What needs to go right for an induction head? a mechanistic study of in-context learning circuits and their formationMHAMagnitude Analysis-ICML2024Link
The developmental landscape of in-context learningMHAMagnitude Analysis-TLMR2025Link
In-Context Meta Learning Induces Multi-Phase Circuit EmergenceMHAMagnitude Analysis-ICLR2025Link
Joint Localization and Activation Editing for Low-Resource Fine-TuningMHAMagnitude AnalysisVector ArithmeticICML2025Link
The slingshot mechanism: An empirical study of adaptive optimizers and the Grokking PhenomenonMHA & FFNMagnitude Analysis-NeurIPS2022Link
Explaining grokking through circuit efficiencyMHA & FFNMagnitude Analysis-ArXiv2023Link
Towards Empirical Interpretation of Internal Circuits and Properties in Grokked Transformers on Modular PolynomialsMHA & FFNMagnitude Analysis-TMLR2024Link
Progress measures for grokking via mechanistic interpretabilityMHA & FFNMagnitude Analysis-ICLR2023Link
Predicting grokking long before it happens: A look into the loss landscape of models which grokMHA & FFNMagnitude Analysis-ArXiv2023Link
Exploring Grokking: Experimental and Mechanistic InvestigationsMHA & FFNMagnitude Analysis-ArXiv2024Link
Omnigrok: Grokking Beyond Algorithmic DataMHA & FFNMagnitude Analysis-ICLR2023Link
Where to find Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without TestMHA & FFNMagnitude Analysis-ArXiv2025Link
Grokking of implicit reasoning in transformers: A mechanistic journey to the edge of generalizationMHA & FFNMagnitude Analysis-NeurIPS2024Link
Unified View of Grokking, Double Descent and Emergent Abilities: A Comprehensive Study on Algorithm TaskMHA & FFNMagnitude Analysis-COLM2024Link
Fine-Tuning is Subgraph Search: A New Lens on Learning DynamicsMHA & FFNCircuit DiscoveryTargeted OptimizationArXiv2025Link
Constructive Circuit Amplification:Improving Math Reasoning in LLMS via Targeted Sub-Network UpdatesMHA & FFNCircuit DiscoveryTargeted OptimizationArXiv2025Link

Efficient Inference

PaperObjectLocalizing MethodSteering MethodVenueYearLink
TokenSkip: Controllable Chain-of-Thought Compression in LLMsToken EmbeddingMagitude AnalysisAmplitude ManipulationEMNLP2025Link
Generic Token Compression in Multimodal Large Language Models from an Explainability PerspectiveToken EmbeddingGradient DetectionAmplitude ManipulationArXiv2025Link
Attention Score is not All You Need for Token Importance Indicator in KV Cache Reduction: Value Also MattersToken EmbeddingMagnitude AnalysisAmplitude ManipulationEMNLP2024Link
Fit and prune: Fast and training-free visual token pruning for multi-modal large language modelsToken EmbeddingMagnitude AnalysisAmplitude ManipulationAAAI2025Link
Zipcache: Accurate and efficient kv cache quantization with salient token identificationToken EmbeddingMagnitude AnalysisAmplitude ManipulationNeurIPS2024Link
Pyramidkv: Dynamic kv cache compression based on pyramidal information funnelingToken EmbeddingMagnitude AnalysisAmplitude ManipulationCOLM2025Link
What Layers When: Learning to Skip Compute in LLMs with Residual GatesResidual StreamMagnitude AnalysisAmplitude ManipulationArXiv2025Link
Accelerating Large Language Model Inference with Self-Supervised Early ExitsResidual StreamProbingAmplitude ManipulationArXiv2024Link
LayerSkip: Enabling Early Exit Inference and Self-Speculative DecodingResidual StreamProbingAmplitude ManipulationACL2024Link
HadSkip: Homotopic and Adaptive Layer Skipping of Pre-trained Language Models for Efficient InferenceResidual StreamMagnitude AnalysisAmplitude ManipulationEMNLP2023Link
Learning to Skip the Middle Layers of TransformersResidual StreamMagnitude AnalysisAmplitude ManipulationArXiv2025Link
ShortGPT: Layers in Large Language Models are More Redundant Than You ExpectResidual StreamMagnitude AnalysisAmplitude ManipulationACL2025Link
Layer-wise quantization: A pragmatic and effective method for quantizing llms beyond integer bit-levelsResidual StreamMagnitude Analysis-ArXiv2024Link
Towards Superior Quantization Accuracy: A Layer-sensitive ApproachResidual StreamMagnitude Analysis-ArXiv2025Link
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language ModelsResidual StreamMagnitude Analysis-ArXiv2025Link
Mix-QViT: Mixed-precision vision transformer quantization driven by layer importance and quantization sensitivityResidual StreamGradient Detection-ArXiv2025Link
Lsaq: Layer-specific adaptive quantization for large language model deploymentResidual StreamVocab Projection-ArXiv2024Link
Towards Building Efficient Sentence BERT Models using Layer PruningResidual StreamCausal AttributionAmplitude ManipulationACL2024Link
KVSink: Understanding and Enhancing the Preservation of Attention Sinks in KV Cache Quantization for LLMsMHA & FFNCircuit Discovery-COLM2025Link
Beyond Outliers: A Data-Free Layer-wise Mixed-Precision Quantization Approach Driven by Numerical and Structural Dual-SensitivityMHA & FFNMagnitude Analysis-ArXiv2026Link
Massive activations in large language modelsMHA & FFNMagnitude Analysis-NeurIPS2024Link
Systematic outliers in large language modelsMHA & FFNCircuit Discovery-ICLR2025Link
Quantizable Transformers: Removing Outliers by Helping Attention Heads Do NothingMHA & FFNCircuit Discovery-NeurIPS2023Link
RazorAttention: Efficient kv cache compression through retrieval headsMHACircuit DiscoveryAmplitude ManipulationICLR2025Link
DuoAttention: Efficient long-context llm inference with retrieval and streaming headsMHACircuit DiscoveryAmplitude ManipulationICLR2025Link
Unveiling visual perception in language models: An Attention head analysis approachMHAMagnitude Analysis-CVPR2025Link
Fast and Low-Cost Genomic Foundation Models via Outlier RemovalMHAMagnitude AnalysisAmplitude ManipulationICML2025Link
FROST: Filtering Reasoning Outliers with Attention for Efficient ReasoningMHAMagnitude AnalysisAmplitude ManipulationICLR2026Link
Rotatekv: Accurate and robust 2-bit kv cache quantization for llms via outlier-aware adaptive rotationsMHAMagnitude AnalysisAmplitude ManipulationIJCAI2025Link
Efficient Streaming Language Models with Attention SinksMHAMagnitude AnalysisAmplitude ManipulationICLR2024Link
Unraveling babel: Exploring multilingual activation patterns within large language modelsNeuronMagnitude AnalysisAmplitude ManipulationArXiv2024Link
Neuron Specialization: Leveraging Intrinsic Task Modularity for Multilingual Machine TranslationNeuronMagnitude Analysis-EMNLP2024Link
The super weight in large language modelsFFNMagnitude AnalysisAmplitude ManipulationArxiv2024Link
Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language modelsFFNMagnitude AnalysisAmplitude ManipulationACL2024Link
Unveiling super experts in mixture-of-experts large language modelsFFNMagnitude AnalysisAmplitude ManipulationArXiv2025Link

🌟 Citation

If you find this survey or repository useful for your research, please cite:

@article{zhang2026locate,
  title={Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models},
  author={Zhang, Hengyuan and Zhang, Zhihao and Wang, Mingyang and Su, Zunhai and Wang, Yiwei and Wang, Qianli and Yuan, Shuzhou and Nie, Ercong and Duan, Xufeng and Xue, Qibo and others},
  journal={arXiv preprint arXiv:2601.14004},
  year={2026}
}

πŸ“§ Contact

Feel free to open an issue or contact us if you have any questions or want to include your work in this list!

Corresponding Author: Hengyuan Zhang (hengyuan.zhang88@gmail.com) and Zhihao Zhang (zhihaozhang017@gmail.com)

Contributors

rattlesnakey

15 commits

zzhang0179

2 commits

qiaw99

1 commits

ShuzhouYuan

1 commits