При проектировании эксперимента авторы тестируют разные архитектуры language modeling. В прикладном применении важны выход и побочные характеристики: скорость, поддержка фреймворков, современность. В теоретическом — поиск интересного результата, а не только практической применимости на конкретной задаче, где важен готовый выход модели.

Три архитектуры работают в разных пространствах, и сравнение моделей разных типов рискует найти эффект там, где его нет. Без чёткого разделения целей эксперимента смешиваются критерии: операционные параметры и теоретическая значимость оказываются в одной шкале, и выводы становятся неоднозначными для исследователя и для практика.

При выборе архитектуры сначала определить, что важнее — качество выхода, скорость и поддержка фреймворков или теоретический результат. Вопрос из материала звучит так: как не найти результат там, где его нет, сравнивая модели разных архитектур? Это снижает риск ложных сравнений между архитектурами из разных пространств language modeling.