모델에이전트 🇷🇺 28.07.2026 07:03

PAC1 및 ECOM1에서의 Kimi K3: 204개 작업 결과 및 실패 분석

Moonshot AIMoonshot AI
Moonshot AI가 7월에 Kimi K3를 오픈소스로 공개했습니다. 이 모델은 두 가지 BitGN 벤치마크(PAC1 및 ECOM1)에서 204개의 오픈 트레이스로 테스트되었습니다. 결과는 단순 검색 및 계산에서 강력한 성능을 보였지만, 다중 파일 원자적 연산, 신뢰할 수 없는 입력 확인, 긴 테이블 일관성에서 빈번한 실패를 보였습니다.
Moonshot AI가 7월 27일 Kimi K3의 오픈 웨이트와 기술 보고서를 공개했다. 독립적으로 성능을 검증하기 위해 모델을 두 가지 BitGN 태스크 세트인 PAC1(문서, 인보이스, 받은 편지함, 배치 파일 변경)과 ECOM1(카탈로그, 재고, 장바구니, 결제, 반품, 물류)에서 실행했다. PAC1은 104점 만점(이진 평가)에 61점, ECOM1은 100점 만점(부분 점수)에 44.75점을 기록했다. 204개의 오픈 트레이스를 통해 모든 명령과 상태 변경을 검사할 수 있다. PAC1에서 단순 검색 및 산술 태스크는 90-92% 성공률을 보였지만, 세 가지 주요 오류 패턴이 드러났다: 정확한 스키마 위반(유사하지만 잘못된 필드 이름 작성), 비원자적 배치 연산(전체 집합 검증 전 부분 파일 변경), 논블로킹 신뢰할 수 없는 입력 검사(위험한 콘텐츠 감지되었지만 작업이 여전히 실행됨). ECOM1에서는 정확한 SKU 검색과 표준 체크아웃이 잘 작동했지만, 오류 패턴에는 다중 행 보고서의 행 간 상태 손실, 과도한 이상 플래깅, 프라이빗 데이터 읽기 전 신원 확인 누락, 신뢰할 수 없는 입력으로 인한 상태 변경이 포함되었다. 최적화 태스크(디스패치 스케줄링)는 가능하지만 최적이 아닌 계획을 제공했다. 다른 공개 BitGN 실행과 비교하면 Kimi K3는 단순 태스크에서 경쟁력이 있지만 복잡한 다단계 제약 조건에서는 뒤처졌다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스