Nghiên cứuMô hình 🇺🇸 10.08.2026 13:03

Các Startup Đuổi Theo Bước Đột Phá Tiếp Theo trong LLM

Liquid AILiquid AI
Một làn sóng các startup đang cố gắng vượt qua những hạn chế của kiến trúc transformer, công nghệ nền tảng cho các mô hình ngôn ngữ lớn (LLM) hiện nay. Họ đề xuất các kiến trúc và kỹ thuật mới để làm cho mô hình nhanh hơn, hiệu quả hơn và có khả năng thông minh hơn, nhằm mục tiêu thách thức các ông lớn trong lĩnh vực AI.
Transformer, được giới thiệu trong một bài báo năm 2017 của Google, là nền tảng của mọi mô hình ngôn ngữ lớn chủ chốt, nhưng cơ chế chú ý dày đặc của chúng tốn kém về mặt tính toán và gặp khó khăn với các ngữ cảnh dài. Các công ty khởi nghiệp đang giải quyết những khiếm khuyết này: Subquadratic tuyên bố mô hình chú ý thưa thớt SubQ của họ sánh ngang với các mô hình ngôn ngữ lớn chính thống; Manifest AI thay thế chú ý bằng 'duy trì công suất' (power retention) và đã phát hành PowerCoder và Brumby; Liquid AI kết hợp transformer với mạng nơ-ron lỏng (liquid neural networks) để tạo ra các mô hình nền tảng lai (LFMs) nhỏ hơn và tiết kiệm năng lượng hơn; Inception sử dụng khuếch tán (diffusion) để tạo ra toàn bộ khối văn bản cùng một lúc, với mô hình Mercury 2 được tuyên bố là nhanh hơn 10 lần so với GPT-4; và mô hình 'Dragon Hatchling' của Pathway xuất sắc trong giải sudoku, gợi ý về việc vượt ra ngoài ngôn ngữ. Các công ty khởi nghiệp này thấy cơ hội để thay đổi cách xây dựng các mô hình ngôn ngữ lớn, với tiềm năng đạt được những bước tiến đáng kể về tốc độ, hiệu quả và năng lực.
Nguồn: MIT Technology Review — bản gốc
Bài viết liên quan trước đây ↓
Tin mới