Трансформеры сдают позиции: стартапы ищут следующую большую идею в LLM, а академические исследования ИИ сталкиваются с новыми реалиями
MIT Technology Review рассматривает ограничения трансформерных моделей в больших языковых моделях и выделяет четыре новые идеи для их преодоления. Кроме того, в дайджесте сообщается о меняющемся ландшафте академических исследований в области ИИ, инфраструктурных сделках Nvidia на сумму 500 миллиардов долларов и других главных технологических новостях.
В главной статье бюллетеня обсуждается, как трансформеры, представленные Google девять лет назад, становятся узким местом в больших языковых моделях из-за их дорогостоящего механизма плотного внимания и неспособности обрабатывать большие объемы информации. Выделяются четыре новых инновационных подхода, которые могут сделать большие языковые модели быстрее, эффективнее и умнее. Другая статья
Показать ещё ↓
Источник: MIT Technology Review —
оригинал
