Lời nhắc quan trọng hơn mô hình: Thử nghiệm với tạo thư xin việc
Ollama
Groq
Google/DeepMind
Сбер
Anthropic
Meta
Một nhà phát triển ứng dụng viết thư xin việc đã tiến hành một loạt thử nghiệm và phát hiện rằng chất lượng lời nhắc ảnh hưởng đến kết quả nhiều hơn sức mạnh của mô hình. Các mô hình cục bộ với 4 tỷ tham số trên một lời nhắc tốt cho thấy khả năng gửi thành công 100%, tương đương với các ông lớn đám mây.
Một nhà phát triển đã tạo ra một ứng dụng tạo thư xin việc cho các vị trí tuyển dụng bằng cách sử dụng mô hình cục bộ (qua Ollama) hoặc API đám mây, và quyết định kiểm tra xem chất lượng văn bản phụ thuộc vào mô hình như thế nào. Anh ta đã tiến hành đánh giá mù với một người bạn đang tìm việc trong lĩnh vực công nghệ thông tin. Lần chạy đầu tiên với ba mô hình (qwen2.5:3b, qwen2.5:7b, llama-3.3-70b) cho kết quả khả năng gửi chỉ 20–30%, và mô hình đám mây không vượt trội hơn mô hình cục bộ. Phân tích cho thấy các lỗi phổ biến: chỗ trống chưa được điền, kinh nghiệm bịa đặt, và ký tự Trung Quốc. Hóa ra vấn đề nằm ở chính prompt—nó được viết bằng tiếng Anh và thiếu các ràng buộc. Sau khi viết lại prompt bằng tiếng Nga, các lỗi cơ học giảm từ 25% xuống còn sạch 100%, nhưng đánh giá của con người vẫn là con số không do sự nhàm chán. Người bạn chỉ ra rằng thư xin việc thường được đọc lướt qua, vì vậy mật độ các điểm nhấn ở đầu câu là quan trọng. Sau mười lần lặp, prompt đã giải thích cho mô hình cách thư được đọc, yêu cầu dòng đầu tiên dựa trên sự kiện, lời chào ngắn, và một đoạn riêng về sự phù hợp với công việc. Với prompt này, các mô hình cục bộ (gemma-3-4b, qwen-3.5-4b) đạt 100% khả năng gửi trên bảy trong tám lá thư, trong khi Claude Opus 4.8 và GigaChat-2-Pro đạt 100% với phong cách sinh động hơn. Trong bài kiểm tra Turing, người bạn đã xác định 6 trong 8 lá thư được tạo ra là do con người viết. Kết luận: prompt đặt ra nền tảng, mô hình nâng cao trần; trên phần cứng yếu, mô hình 4B cục bộ đã tạo ra những lá thư tốt.
Nguồn: Habr — хаб ИИ —
bản gốc
