Benchmarkwerte allein sagen wenig über die tatsächlichen Kosten von KI-Agenten aus
Hohe Benchmarkwerte garantieren weder niedrige Kosten noch verlässliche Ergebnisse bei KI-Agenten. Entscheidend sind oft Grenzen für Zeit und Tokens sowie die Kosten fehlgeschlagener Versuche. Laurie Voss schreibt bei VentureBeat, dass sich dies am Beispiel von Alibabas Qwen 3.8-Max zeigt. Alibaba weist für Coding-Tests Zeitlimits von bis zu fünf Stunden aus. Bei einem Forschungsbenchmark sind es …