Fireworks AI ra mắt Fireworks Nexus: Lớp định tuyến và kiểm soát chi phí chuyển các tác vụ lập trình thông thường sang các mô hình trọng số mở
Fireworks AI
Anthropic
Moonshot AI
OpenAI
Fireworks AI đã ra mắt Fireworks Nexus, một nền tảng quản lý và định tuyến AI dành cho các tổ chức kỹ thuật. Nó giảm chi phí bằng cách định tuyến các tác vụ lập trình thông thường sang các mô hình trọng số mở, trong khi giữ các tác vụ khó khăn trên các mô hình tiên tiến. Các đánh giá độc lập từ Faros AI và Arize ủng hộ cách tiếp cận này, cho thấy mức giảm chi phí từ 3 đến 5 lần và cải thiện hiệu quả.
Fireworks AI đã phát hành Fireworks Nexus, một nền tảng quản lý và định tuyến AI nhắm đến các tổ chức kỹ thuật. Nó kết nối các công cụ viết mã hiện có với một lớp quản lý các mô hình mã nguồn mở (open-weight models), giải quyết tình trạng kém hiệu quả về chi phí khi các tác vụ thường ngày được chạy trên các mô hình tiên tiến (frontier models) đắt đỏ. Nexus bao gồm ba thành phần: kiểm soát doanh nghiệp và khả năng quan sát chi phí, liên tục quy trình làm việc thông qua FireConnect (cài đặt một dòng theo giấy phép Apache 2.0), và quản lý lưu lượng thông minh sử dụng một mô hình tùy chỉnh để đánh giá độ khó của yêu cầu. Bộ định tuyến hiện đang ở giai đoạn xem trước nghiên cứu (research preview), hiện tại định tuyến giữa Claude Opus 5 và GLM-5.2 với cơ chế chuyển tiếp khóa (key pass-through) của Anthropic, hoặc Kimi K3 và GLM-5.2 ở chế độ hoàn toàn mở. Thử nghiệm sơ bộ với Notion và Doximity cho thấy chi phí mỗi yêu cầu kéo (pull request) được hợp nhất giảm 33%. Faros AI đã đánh giá 211 tác vụ kỹ thuật thực tế trên bảy tuyến đường (routes), phát hiện rằng Claude Code trên GLM-5.2 đạt 0,568 điểm so với 0,521 điểm của Claude Code trên Opus 4.8, với chi phí lần lượt là 0,92 đô la Mỹ và 1,76 đô la Mỹ mỗi tác vụ. Arize đã đánh giá 10 mô hình trên 40 tác vụ Terminal-Bench với 2.400 lần chạy, cho thấy rằng một thang leo thang có chủ ý (deliberate escalation ladder) đánh bại mọi chiến lược đơn mô hình với chi phí 0,525 đô la Mỹ mỗi tác vụ thành công và giải quyết được 32,3/40 tác vụ, so với 0,636 đô la Mỹ và 25/40 tác vụ đối với chỉ riêng GPT-5.5. Có ba đường triển khai: plugin FireConnect, cấu hình API trực tiếp, hoặc bộ định tuyến đặt trước một hợp đồng tiên tiến (frontier contract).
Nguồn: MarkTechPost —
bản gốc
