Startup'lar Büyük Dil Modellerinde Bir Sonraki Büyük Şeyin Peşinde
Liquid AI
Bir startup dalgası, günümüzdeki büyük dil modellerinin (LLM) temelini oluşturan transformatörlerin sınırlamalarını aşmaya çalışıyor. Modelleri daha hızlı, daha verimli ve potansiyel olarak daha akıllı hale getirmek için yeni mimariler ve teknikler öneriyorlar; böylece yapay zeka devlerini tahtından etmeyi hedefliyorlar.
2017'de Google'ın bir makalesinde tanıtılan Transformers, tüm büyük dil modellerinin temelini oluşturuyor, ancak yoğun dikkat mekanizması hesaplama açısından pahalı ve uzun bağlamlarda zorlanıyor. Startup'lar bu kusurlarla mücadele ediyor: Subquadratic, seyrek dikkat modeli SubQ'nun ana akım LLM'lerle rekabet ettiğini iddia ediyor; Manifest AI, dikkat mekanizmasını 'güç belleği' ile değiştiriyor ve PowerCoder ile Brumby'yi yayınladı; Liquid AI, transformer'ları sıvı sinir ağlarıyla birleştirerek daha küçük ve enerji açısından daha verimli hibrit LFM'ler (sıvı temel modeller) oluşturuyor; Inception, tüm metin bloklarını aynı anda üretmek için difüzyon kullanıyor ve Mercury 2 modelinin GPT-4'ten 10 kat daha hızlı olduğu iddia ediliyor; ve Pathway'in 'Dragon Hatchling' modeli sudoku bulmacalarında başarılı, bu da dilin ötesine geçişi işaret ediyor. Bu startup'lar, LLM'lerin nasıl inşa edildiğini değiştirme fırsatı görüyor ve hız, verimlilik ve yetenek açısından önemli kazanımlar potansiyeli taşıyor.
Kaynak: MIT Technology Review —
orijinal
