2025-04-30 09:00
比起各种大模型BenchMark,不如来比比生活中真正会遇到的离谱问题。最近测试了多个新发布的大语言模型,通过一些趣味活动如海龟汤推理游戏、钢琴演奏和回应亲戚的视频观点,来评测这些模型的推理和应用能力。
内容为转载
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
频道: 视频
比起各种大模型BenchMark,不如来比比生活中真正会遇到的离谱问题。最近测试了多个新发布的大语言模型,通过一些趣味活动如海龟汤推理游戏、钢琴演奏和回应亲戚的视频观点,来评测这些模型的推理和应用能力。