Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models. Marks, S., Rager, C., Michaud, E. J., Belinkov, Y., Bau, D., & Mueller, A. CoRR, 2024.
Paper doi bibtex @article{DBLP:journals/corr/abs-2403-19647,
author = {Samuel Marks and
Can Rager and
Eric J. Michaud and
Yonatan Belinkov and
David Bau and
Aaron Mueller},
title = {Sparse Feature Circuits: Discovering and Editing Interpretable Causal
Graphs in Language Models},
journal = {CoRR},
volume = {abs/2403.19647},
year = {2024},
url = {https://doi.org/10.48550/arXiv.2403.19647},
doi = {10.48550/ARXIV.2403.19647},
eprinttype = {arXiv},
eprint = {2403.19647},
timestamp = {Mon, 03 Mar 2025 00:00:00 +0100},
biburl = {https://dblp.org/rec/journals/corr/abs-2403-19647.bib},
bibsource = {dblp computer science bibliography, https://dblp.org}
}
Downloads: 0
{"_id":"FBJPyFqdFJrue5yag","bibbaseid":"marks-rager-michaud-belinkov-bau-mueller-sparsefeaturecircuitsdiscoveringandeditinginterpretablecausalgraphsinlanguagemodels-2024","author_short":["Marks, S.","Rager, C.","Michaud, E. J.","Belinkov, Y.","Bau, D.","Mueller, A."],"bibdata":{"bibtype":"article","type":"article","author":[{"firstnames":["Samuel"],"propositions":[],"lastnames":["Marks"],"suffixes":[]},{"firstnames":["Can"],"propositions":[],"lastnames":["Rager"],"suffixes":[]},{"firstnames":["Eric","J."],"propositions":[],"lastnames":["Michaud"],"suffixes":[]},{"firstnames":["Yonatan"],"propositions":[],"lastnames":["Belinkov"],"suffixes":[]},{"firstnames":["David"],"propositions":[],"lastnames":["Bau"],"suffixes":[]},{"firstnames":["Aaron"],"propositions":[],"lastnames":["Mueller"],"suffixes":[]}],"title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","journal":"CoRR","volume":"abs/2403.19647","year":"2024","url":"https://doi.org/10.48550/arXiv.2403.19647","doi":"10.48550/ARXIV.2403.19647","eprinttype":"arXiv","eprint":"2403.19647","timestamp":"Mon, 03 Mar 2025 00:00:00 +0100","biburl":"https://dblp.org/rec/journals/corr/abs-2403-19647.bib","bibsource":"dblp computer science bibliography, https://dblp.org","bibtex":"@article{DBLP:journals/corr/abs-2403-19647,\n author = {Samuel Marks and\n Can Rager and\n Eric J. Michaud and\n Yonatan Belinkov and\n David Bau and\n Aaron Mueller},\n title = {Sparse Feature Circuits: Discovering and Editing Interpretable Causal\n Graphs in Language Models},\n journal = {CoRR},\n volume = {abs/2403.19647},\n year = {2024},\n url = {https://doi.org/10.48550/arXiv.2403.19647},\n doi = {10.48550/ARXIV.2403.19647},\n eprinttype = {arXiv},\n eprint = {2403.19647},\n timestamp = {Mon, 03 Mar 2025 00:00:00 +0100},\n biburl = {https://dblp.org/rec/journals/corr/abs-2403-19647.bib},\n bibsource = {dblp computer science bibliography, https://dblp.org}\n}\n\n","author_short":["Marks, S.","Rager, C.","Michaud, E. J.","Belinkov, Y.","Bau, D.","Mueller, A."],"key":"DBLP:journals/corr/abs-2403-19647","id":"DBLP:journals/corr/abs-2403-19647","bibbaseid":"marks-rager-michaud-belinkov-bau-mueller-sparsefeaturecircuitsdiscoveringandeditinginterpretablecausalgraphsinlanguagemodels-2024","role":"author","urls":{"Paper":"https://doi.org/10.48550/arXiv.2403.19647"},"metadata":{"authorlinks":{}}},"bibtype":"article","biburl":"https://dblp.org/pid/47/3614.bib","dataSources":["RrWNL5jPwmWqcdgCS"],"keywords":[],"search_terms":["sparse","feature","circuits","discovering","editing","interpretable","causal","graphs","language","models","marks","rager","michaud","belinkov","bau","mueller"],"title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","year":2024}