Para que serve o Oqoqo?
Oqoqo é projetado para criar avaliações e benchmarks privados para tarefas agentivas do mundo real, permitindo que os usuários avaliem se os agentes podem usar efetivamente vários produtos.
Como isso é diferente de tentar um agente eu mesmo?
Oqoqo permite avaliações repetidas entre agentes, modelos e tratamentos, fornecendo dados abrangentes sobre o desempenho em vez de um teste único.
Posso construir benchmarks privados?
Sim, os usuários podem escrever suas próprias tarefas e rubricas em linguagem simples, que são versionadas com cada experimento para comparabilidade.
O que vejo após uma execução?
Após uma execução, os usuários recebem relatórios detalhados sobre os resultados de aprovação ou reprovação, incluindo toda a trajetória do experimento, métricas e razões para falhas.
Quais agentes posso executar?
Oqoqo suporta vários agentes, incluindo Claude Code, Codex, Cursor, GitHub Copilot e mais, permitindo que os usuários escolham modelos com base em suas necessidades.