В то время как системы искусственного интеллекта берутся за все более сложные задачи, прогресс в отрасли в значительной степени обусловлен увеличением масштаба моделей, объемов обучающих данных, длины контекста и вычислительной мощности во время инференса. Однако компания Pathway предлагает альтернативный подход, разрабатывая архитектуру BDH (Dragon Hatchling), вдохновленную работой мозга. Вместо того чтобы выполнять рассуждения последовательно, генерируя дополнительные токены и подавая их обратно на последующие шаги, BDH осуществляет рассуждения в латентном пространстве. Модель учится на примерах и уточняет решения без генерации промежуточного текстового следа. BDH выходит за рамки парадигмы трансформеров, предлагая архитектуру, изначально сформулированную как граф нейронов, которые взаимодействуют посредством разреженных локальных связей и поддерживают состояние в синапсоподобных соединениях. Состояния модели адаптируются в контексте без обновлений весов во время тестирования, а горизонт рассуждений не ограничен окном фиксированного размера или потоком неэффективных токенов цепочки рассуждений. Большие языковые модели (LLM) изменили ИИ, трансформировав подходы к задачам от генерации кода до творческого письма. Тем не менее, остаются фундаментальные вопросы относительно общего интеллекта и их способности последовательно рассуждать в течение длительных периодов времени. Их архитектура, остававшаяся примерно статичной последние 10 лет, по-прежнему демонстрирует значительную неэффективность как в обучении, так и в инференсе. LLM склонны забывать во время длительных взаимодействий, не сохраняют знания между сессиями и требуют переобучения для получения новых знаний.
Ограничения архитектуры трансформеров
Архитектура трансформеров, широко используемая в обработке естественного языка (NLP), сталкивается со значительными ограничениями как в рабочих нагрузках обучения, так и в инференсе. Во время обучения трансформеры испытывают трудности с систематической обобщающей способностью за пределами своих обучающих данных, особенно для задач рассуждения с длинной цепочкой мыслей, и требуют огромных объемов данных и вычислительных усилий для компенсации этого ограничения. Плотные вычислительные паттерны архитектуры трансформеров и требования к полной обратной связи приводят к существенным вычислительным затратам, которые экспоненциально растут с размером модели.
Существует отсутствие четких связей между динамикой на микроуровне (то есть активацией нейронов) и макроповедением (то есть почему модель отвечает именно так). Трудно эффективно обновлять знания без полного переобучения или тонкой настройки, потому что трансформеры часто сталкиваются с катастрофическим забыванием, когда изучение чего-то нового приводит к забыванию чего-то другого. Во время инференса трансформеры сталкиваются с другими неэффективностями: структура их механизма внимания ограничивает масштабируемость, в то время как их плотные паттерны активации, даже с использованием методов Mixture of Experts, приводят к чрезмерным вычислениям и использованию пропускной способности памяти. Фиксированное окно контекста и растущий KV-кэш накладывают ограничения на обработку последовательностей. Кроме того, закрытый характер состояния трансформера делает практически невозможным интерпретацию или мониторинг процесса рассуждения модели, что вызывает опасения относительно надежности и безопасности в производственных средах и строго регулируемых отраслях. Эти проблемы фундаментально связаны с проектными решениями архитектуры, а не только с деталями реализации, что указывает на необходимость альтернативных подходов, которые лучше соответствуют как вычислительной эффективности, так и принципам естественного интеллекта.
BDH: Единая архитектура для искусственного и естественного интеллекта
Видение Pathway заключается в фундаментальном изменении способа мышления моделей. Их архитектура BDH представляет собой посттрансформерную модель, которая постоянно учится, развивается и рассуждает. Архитектура BDH представляет собой новый способ построения языковых моделей, который переформулирует моделирование последовательностей как локальную динамику графа в сети взаимодействующих нейронных частиц. Модель использует хеббовское обучение, принцип «нейроны, которые активируются вместе, связываются вместе», для реализации механизмов внимания. Этот подход масштабируется в одном нейронном измерении (n), что снижает сложность распределения вычислительных ресурсов, с которой мы сталкиваемся при развертывании трансформеров.
Как и в мозге, взаимодействия BDH определены как разреженные и локальные, а связи между нейронами кодируют функции памяти и рассуждения. Этот разреженный профиль активации (обычно активно только 5 процентов нейронов в данный момент времени) поддерживает эффективные вычисления. Уменьшенное активное состояние означает, что для каждого шага инференса требуется меньше вычислений, что приводит к повышению производительности в производственных средах. BDH реализует внимание через линейный механизм, который работает с фиксированными высокоразмерными состояниями без увеличения сложности, характерной для моделей трансформеров для длинных контекстов. Это позволяет модели более эффективно обрабатывать более длинные последовательности без ограничений длины контекста архитектур трансформеров. Состояния модели напрямую отображаются на синаптические связи между парами нейронов, обеспечивая видимость процесса рассуждения и облегчая интерпретацию принятия решений моделью.
Недавно Pathway создала BDH-CQ, систему рассуждений, построенную на основе BDH. Она расширяет BDH за счет обучения в контексте и латентного итеративного рассуждения для решения визуальных задач. BDH-CQ превосходно справляется с обучением в контексте. Ее рекуррентные вычисления над латентными состояниями поддерживают эффективное параллельное исследование гипотез, где сообщества нейронов могут представлять различные кандидатские решения для текущей проблемы. Модель достигает эффективности рассуждений, которая может обрабатывать произвольное количество демонстраций при фиксированных затратах памяти.
Разработка архитектуры BDH на Amazon SageMaker HyperPod
Pathway использует Amazon SageMaker HyperPod для разработки своей архитектуры BDH. Amazon SageMaker HyperPod — это специализированное инфраструктурное решение для обучения LLM и базовых моделей (FM), которые требуют распределенного обучения или инференса на сотнях или тысячах графических процессоров. Оно предоставляет полностью управляемую высокопроизводительную среду обучения машинного обучения (ML) с автоматическим выделением кластеров, оптимизированной сетевой инфраструктурой и настраиваемыми программными стеками. Для разработчиков моделей Amazon SageMaker HyperPod обеспечивает три ключевых преимущества: сокращение времени выхода на рынок за счет устранения сложной настройки и управления инфраструктурой, повышение экономической эффективности за счет автоматического масштабирования и улучшение производительности модели за счет специализированной сетевой архитектуры.
Источник: Artificial Intelligence







































