À quoi sert Oqoqo ?
Oqoqo est conçu pour créer des évaluations et des benchmarks privés pour des tâches agentiques du monde réel, permettant aux utilisateurs d'évaluer si les agents peuvent utiliser efficacement divers produits.
En quoi cela diffère-t-il d'essayer un agent moi-même ?
Oqoqo permet des évaluations répétées à travers des agents, des modèles et des traitements, fournissant des données complètes sur la performance plutôt qu'un test unique.
Puis-je créer des benchmarks privés ?
Oui, les utilisateurs peuvent rédiger leurs propres tâches et rubriques en langage clair, qui sont versionnées avec chaque expérience pour la comparabilité.
Que vois-je après une exécution ?
Après une exécution, les utilisateurs reçoivent des rapports détaillés sur les résultats de réussite ou d'échec, y compris la trajectoire complète de l'expérience, les métriques et les raisons des échecs.
Quels agents puis-je exécuter ?
Oqoqo prend en charge divers agents, y compris Claude Code, Codex, Cursor, GitHub Copilot, et plus encore, permettant aux utilisateurs de choisir des modèles en fonction de leurs besoins.