Исследовательская команда Goodfire 30 апреля опубликовала на arXiv статью под названием «Do Sparse Autoencoders Capture Concept Manifolds?», в которой систематически изучается геометрическая структура концепций внутри крупномасштабных языковых моделей. В ходе исследования было установлено, что концепции в моделях не представляют собой отдельные линейные направления, как предполагается в распространенной «гипотезе линейного представления», а образуют многомерные поверхностные многообразия. Спарсные автоэнкодеры (SAE), являющиеся ключевым инструментом современных исследований по интерпретируемости ИИ, при работе с такими поверхностными структурами не способны напрямую уловить их полную геометрию; вместо этого они разбивают эти поверхности на множество линейных фрагментов посредством процессов «укладки» и «дробления». В статье формализованы закономерности данного механизма, а также продемонстрировано визуальное представление концептуальных многообразий за период с 1800 по 1998 год.
Кроме того, в работе задача обнаружения неконтролируемых многообразий переформулирована как «обратная задача Изинга»; для её решения используется рамка вывода из статистической физики, обеспечивающая более понятную теоретическую основу. Goodfire одновременно выпустила в открытый доступ инструмент автоматического поиска формы, позволяющий самостоятельно определять «геометрические структуры», используемые моделями, на основе их активационных значений; платформа Silico компании также предоставляет услуги по управлению процессом обнаружения многообразий. В настоящее время инструменты SAE от Goodfire применяются для анализа внутренних представлений таких моделей, как Llama 3.3 70B; данное исследование дает более систематическое теоретическое объяснение границ возможностей SAE с геометрической точки зрения и указывает направление дальнейшего развития области механистической интерпретируемости — бесконтрольное восстановление геометрии признаков исключительно на основе активационных значений.