Следите за последними материалами, объяснениями и связанными технологическими историями.
GitHub запустила открытый бенчмарк ReviewBench для оценки агентов проверки кода на основе 219 запросов на слияние из 187 репозиториев и 19 языков программирования, с метриками, различающими обнаружение известных и новых проблем. Компания заявляет, что его офлайн-результаты отразили тенденции производственных экспериментов с Copilot Code Review, однако реальные пользовательские испытания остаются окончательным критерием оценки.