DeepSeek, V4-Flash-0731 업그레이드: 에이전트 코딩 및 API 베타에서 큰 성과
DeepSeek
Anthropic
DeepSeek가 프리뷰 버전의 공식 업그레이드인 DeepSeek-V4-Flash-0731을 출시했습니다. 이 모델은 에이전트 및 코딩 벤치마크에서 상당한 개선을 보여줍니다. 동일한 아키텍처를 유지하면서도 재학습을 통해 성능이 향상되었으며, API는 이제 공개 베타로 제공되어 Responses API 형식과 Codex 적응을 지원합니다. 가중치는 MIT 라이선스로 제공되며 게이트 없이 공개되어 다양한 배포 옵션을 가능하게 합니다.
DeepSeek가 2026년 7월 31일에 Hugging Face에 DeepSeek-V4-Flash-0731을 게시하고 공식 V4-Flash API를 공개 베타로 전환했습니다. 모델 카드에 따르면 이번 릴리스는 프리뷰를 대체하는 공식 출시이며 아키텍처와 크기는 변경되지 않았고 향상된 부분은 재사전학습을 통한 것입니다. 체크포인트에는 DSpark 추측 디코딩 모듈이 포함되어 있으며, Hugging Face는 기본 284B 모델 위에 드래프트 모듈을 포함해 총 304B 매개변수라고 보고합니다. API는 이제 Responses API 형식을 기본 지원하며 Codex에 맞게 조정되었지만, V4-Pro API와 앱/웹 모델은 업데이트되지 않았습니다. 배포는 API를 통해 저렴한 비용(프로 출력 가격의 약 1/3)으로 가능하며, 자체 호스팅도 가능하지만 상당한 리소스가 필요합니다. MIT 라이선스의 가중치이지만 모든 전문가가 메모리에 상주해야 합니다. vLLM 예시는 4×GB300 노드에서 서빙하며, Unsloth 동적 GGUF는 공격적인 양자화 시 약 110GB 메모리에 맞습니다. 아키텍처는 토큰당 13B 활성 매개변수로 284B 매개변수, 1M 토큰 컨텍스트, CSA와 HCA를 포함한 하이브리드 어텐션, 다양체 제약 하이퍼 커넥션을 포함합니다. 벤치마크에서 V4-Flash-0731은 모든 에이전트 벤치마크에서 V4-Pro(프리뷰)를 능가하지만, 모든 수치는 DeepSeek가 공개하지 않은 하네스에서 자체 보고한 것입니다. DSpark는 vLLM 플래그로 활성화되며, 모델은 Jinja 채팅 템플릿 대신 인코딩 폴더를 사용합니다.
출처: MarkTechPost —
원문
