社群熱議 Qwen 與 Gemma 的基準測試僵局AI 從業者正在討論 Qwen 與 Gemma 模型在基準測試效能上似乎陷入停滯或「僵局」,這引發了對評估指標有效性的質疑。Reddit r/LocalLLaMACommunity•Jul 6#benchmarking#model-evaluation#llm-performance