비즈니스 및 시장오픈 소스 🇷🇺 27.07.2026 04:03

LLM 비용 절감: 중국 모델이 예기치 않게 한자를 출력하기 시작하다

TencentTencent DeepSeekDeepSeek
한 AI 뉴스 수집 봇이 8배 저렴한 중국 모델(ling-2.6-flash)로 전환했지만, 이 모델이 러시아어 출력에 한자를 자주 생성한다는 사실을 발견했습니다. 개발자는 CJK 감지 기능을 추가하고 더 비싼 모델로 후처리하는 방식을 도입하여 약 42%의 순비용 절감 효과를 얻었습니다.
한 언어로 된 이중 언어 뉴스 피드 봇을 운영하는 개발자가 하루 약 936회의 LLM 호출을 하면서 OpenRouter에서 더 저렴한 모델을 찾았습니다. 17개의 무료 모델 중 단 3개만 사용할 수 있었고, 속도나 JSON 지원 부족 같은 문제가 있었습니다. 그런 다음 개발자는 중국 유료 모델인 inclusionai/ling-2.6-flash를 발견했는데, 입력 토큰 100만 개당 $0.010으로 이전에 사용하던 deepseek-v4-flash($0.098)보다 8배 저렴하고 4배 빠릅니다. 그러나 배포 후 봇이 러시아 뉴스 헤드라인에 중국어 문자를 출력하기 시작했습니다. 테스트 결과 짧은 요약의 17%와 긴 분석의 57%에 중국어 텍스트가 포함되어 있었습니다. 해결책은 CJK 정규 표현식 감지기를 추가하는 것이었습니다. 중국어 문자가 발견되면 동일한 요청을 깨끗한 deepseek-v4-flash 모델로 다시 보냈습니다. 수정 후 오염률이 0%(8건 중 0건)로 떨어졌습니다. 또한 개발자는 세 가지 예상치 못한 교훈을 얻었습니다. 비용은 사용자 수가 아닌 뉴스 소스에 의해 결정됩니다. 무료 모델은 계정 잔액이 마이너스가 되면 작동을 멈춥니다 ($0 모델조차도). 그리고 max_tokens 매개변수가 누락되면 거대한 토큰 예약이 발생합니다. 최종 파이프라인은 ling-2.6-flash를 기본, deepseek-v4-flash를 CJK 정리를 위한 대체, gemma:free를 최후의 수단으로 사용합니다. 월 비용은 $14.8에서 약 $8.6으로 줄어들어 예상했던 8배 절감이 아닌 42% 절감을 보였는데, 이는 긴 분석에 대해 이중 지불이 발생하기 때문입니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스