Wofür ist Oqoqo gedacht?
Oqoqo ist dafür konzipiert, Bewertungen und private Benchmarks für reale agentische Aufgaben zu erstellen, sodass Benutzer beurteilen können, ob Agenten verschiedene Produkte effektiv nutzen können.
Wie unterscheidet sich das vom eigenen Test eines Agenten?
Oqoqo ermöglicht wiederholte Bewertungen über Agenten, Modelle und Behandlungen hinweg und bietet umfassende Daten zur Leistung anstelle eines einmaligen Tests.
Kann ich private Benchmarks erstellen?
Ja, Benutzer können ihre eigenen Aufgaben und Rubriken in einfacher Sprache schreiben, die mit jedem Experiment versioniert werden, um die Vergleichbarkeit zu gewährleisten.
Was sehe ich nach einem Durchlauf?
Nach einem Durchlauf erhalten die Benutzer detaillierte Berichte über Bestehen oder Misserfolg, einschließlich des vollständigen Verlaufs des Experiments, Kennzahlen und Gründe für Misserfolge.
Welche Agenten kann ich ausführen?
Oqoqo unterstützt verschiedene Agenten, darunter Claude Code, Codex, Cursor, GitHub Copilot und mehr, sodass Benutzer Modelle basierend auf ihren Bedürfnissen auswählen können.