#contributionDirect oracle-versus-achieved performance comparison
The study separates theoretical pool potential from realised system performance, showing why apparently complementary candidate sets may fail under actual routing, voting, or judge-based aggregation.
↳ Results §§4.2–4.3; Figures 4–5
#methodological rigourBroad comparative experimental coverage
Eight selection strategies are evaluated across 23 models, six families, three scientific benchmarks, and three before- and after-generation MAS forms.
↳ Methods §3; Table 1; Appendix B
#positioningConflicting evidence and limits addressed
The discussion contrasts its results with studies reporting benefits from greater diversity, while the limitations identify architecture, tool-use, task-domain, family-size, and judge boundaries.
↳ Related Work §2; Discussion §5; Limitations