Nghiên cứuỨng dụng 🇷🇺 28.07.2026 14:03

Tại sao Tesla sẽ không bao giờ tạo ra một hệ thống tự lái thực sự đáng tin cậy hoàn toàn

TeslaTesla Moonshot AIMoonshot AI
Bài viết lập luận rằng các phương pháp thị giác máy tính truyền thống đã chạm trần và về cơ bản không thể giải quyết các nhiệm vụ như tự lái hoàn toàn hoặc hệ thống Content ID của YouTube một cách hiệu quả. Bài viết khẳng định rằng trí tuệ nhân tạo hiện đại dựa vào sự tương quan thống kê thay vì nhận dạng thực sự, đồng thời giới thiệu TAPe (Lý thuyết Nhận thức Chủ động) như một cách tiếp cận đột phá giải quyết các bài toán nhận dạng với nguồn lực tối thiểu.
Bài viết lập luận rằng các phương pháp xử lý hình ảnh và video truyền thống, bao gồm mạng nơ-ron capsule (capsule networks) và các bộ chuyển đổi video (video transformers), đã chạm đến giới hạn phát triển và đòi hỏi nguồn lực khổng lồ ngay cả với những tác vụ đơn giản. Bài viết dẫn chứng bằng hệ thống Content ID của YouTube: dù đã trải qua 10 năm phát triển và tiêu tốn 100 triệu USD, hệ thống này vẫn không thể xử lý hiệu quả các đoạn clip ngắn. Tính năng Full Self-Driving (FSD - Tự lái hoàn toàn) của Tesla cũng bị chỉ trích vì vẫn chỉ dừng ở cấp độ 2 theo phân loại của Hiệp hội Kỹ sư Ô tô (SAE - Society of Automotive Engineers), dù đã được hứa hẹn cao hơn, đồng thời vẫn đòi hỏi sự giám sát liên tục của con người và đối mặt với các cuộc điều tra sau những vụ tai nạn. Tác giả cho rằng AI hiện đại về bản chất bị giới hạn vì nó dựa vào các mối tương quan thống kê từ những tập dữ liệu lớn thay vì sự thấu hiểu thực sự, dẫn đến thất bại trong các tình huống hiếm gặp. Bài viết giới thiệu TAPe (Theory of Active Perception - Lý thuyết Nhận thức Chủ động), một phương pháp biểu diễn cảnh vật bằng các T-bit có cấu trúc, mã hóa cả hình học lẫn ngữ nghĩa, cho phép nhận diện chỉ với nguồn lực tối thiểu. Đối với Content ID, TAPe chia video thành các cảnh được mô tả chỉ bằng 48 byte mỗi cảnh, cho phép đối chiếu tức thời trong kho lưu trữ với bất kỳ quy mô nào chỉ bằng một máy chủ duy nhất mà không cần đến GPU. Tác giả khẳng định rằng đối với hệ thống tự lái, riêng thị giác máy tính (computer vision) là chưa đủ, nhưng TAPe đã giải quyết trọn vẹn phần thị giác này.
Nguồn: Хабр — Data Mining — bản gốc
Bài viết liên quan trước đây ↓
Tin mới