Baidu ERNIE Agent lidera o ranking do renomado benchmark de LLMs PinchBench v2
Baidu
O modelo agente Baidu ERNIE liderou o ranking do PinchBench v2, superando GPT-4 e outros modelos. Essa conquista destaca a liderança da Baidu em agentes de inteligência artificial.
Modelo agente ERNIE da Baidu (Agente de Tarefas Wenxin) alcançou o primeiro lugar no ranking do popular benchmark para grandes modelos de linguagem, PinchBench v2. Esse resultado demonstra um progresso significativo da Baidu no campo de agentes de inteligência artificial, que permitem a execução de tarefas complexas. Durante os testes, o modelo superou concorrentes, incluindo o GPT-4 da OpenAI. O PinchBench v2 é um teste de referência que avalia as capacidades dos modelos em resolver tarefas usando ferramentas e planejamento.
Fonte: Baidu ERNIE (GNews) —
original
