ACE를 고려 중인가요? 더 적은 토큰으로도 가능합니다
DeepSeek
OpenAI
이 블로그에서는 ACE(Agentic Context Engineering)와 ALTK-Evolve라는 두 에이전트 메모리 시스템을 비교합니다. 두 시스템 모두 에이전트의 과거 궤적을 재사용 가능한 교훈으로 변환하며 가중치 업데이트 없이 동작합니다. 교훈을 압축하지 않는다는 점에서는 일치하지만, 전달 방식에서 차이가 있습니다. ACE는 매 단계마다 포괄적인 플레이북을 주입하는 반면, ALTK-Evolve는 모델과 작업에 따라 보낼 지침의 수를 조정합니다. AppWorld에서 ALTK-Evolve는 추론 비용의 일부만으로 동일하거나 더 나은 정확도를 달성합니다.
이 블로그는 ALTK-Evolve를 소개하고 ACE(에이전트 컨텍스트 엔지니어링)와 비교합니다. 둘 다 에이전트 메모리의 한 형태로, 에이전트의 과거 궤적을 재사용 가능한 교훈으로 변환하고, 가중치를 업데이트하지 않고 추론 시에 주입합니다. 두 시스템은 교훈을 압축하지 않는다는 핵심 원칙에 동의합니다. ACE는 각 항목에 유익/유해 카운터가 있는 포괄적이고 진화하는 플레이북을 사용하는 반면, ALTK-Evolve는 유사한 교훈을 클러스터로 통합하고 각 지침에 대한 지지 횟수를 유지하며 저장소를 요약하지 않습니다. 메모리를 구축하고 전달하는 방식에서 차이가 있습니다. ACE는 Generator, Reflector, Curator 루프를 통해 단일 플레이북을 성장시키고 델타 업데이트와 임베딩 기반 중복 제거를 사용하는 반면, ALTK-Evolve는 거의 중복된 항목을 클러스터링하고, 지지 보존을 통한 병합을 지원하며, 하위 작업 세분성에서 출처를 포함한 유형별 지침(전략, 복구, 최적화)을 추출합니다. 핵심 차이는 전달 방식입니다. ACE는 모든 단계에서 전체 플레이북을 주입하는 반면, ALTK-Evolve는 지지도가 높은 지침의 작은 고정 코어와 작업별 선택 항목을 보내거나, 모델이 처리할 수 있다면 전체 세트를 보냅니다. 동일한 ReAct 에이전트를 사용한 AppWorld 벤치마크에서 ALTK-Evolve는 훨씬 적은 토큰으로 더 높거나 비슷한 TGC 및 SGC 점수를 달성했습니다. DeepSeek-V3.2의 경우 TGC 89.3 대 80.4, 작업당 토큰 263K 대 634K, gpt-oss-120b의 경우 TGC 56.0 대 54.8, 토큰 116K 대 777K입니다. 정확도 향상은 전체 플레이북을 주입하는 대신 작업당 몇 가지 지침을 검색하기 때문에 얻어집니다. 난이도별 분석에 따르면 어려운 작업에서는 선별된 검색이 전체 플레이북보다 성능이 좋은 반면, 쉬운 작업에서는 전체 플레이북이 더 도움이 될 수 있지만 차이는 작습니다. 블로그는 ACE의 효율성은 컨텍스트를 저렴하게 구축하는 데 있는 반면, ALTK-Evolve의 효율성은 이를 서빙하는 데 있으며, 전달의 보정이 토큰 절감을 이끈다고 언급합니다. 추출, 통합, 검색 파이프라인을 포함한 ALTK-Evolve 라이브러리와 전체 기술 보고서를 사용할 수 있습니다.
출처: Hugging Face blog —
원문
