今天看到新聞,中國隊取得第66屆國際數學奧林匹克競賽(IMO)團體冠軍,六名選手全部獲得金牌。這是過去七年中,中國對第六次奪冠。這已經不是新聞,比較有趣的是好幾名AI“選手”也參加了比賽。計有OpenAI的O3 和O4,谷歌的 Gemini 2.5, 馬斯克的Grok-4,中國的 DeepSeek-R1 等目前的世界一流AI。 AI選手在這次比賽全軍覆沒,連“幾乎”都沒有。得分最高的是Gemini 2.5,得到13分,在42分的滿分中,的31%,連銅牌都不到。 然而,文章後面來了這一段,我怎麼都看不懂。 “就在大家感嘆AI太菜的時候,OpenAI團隊用最新開發的通用推理模型,在兩場4.5小時的考試時間中,和人類完全相同的考試條件下作答。 最終解出5道題,共獲得35分IMO金牌分數線,成功拿到了金牌。” 這裡至少有兩個問題。OpenAI有沒有參賽,好像沒有,否則不會說“全軍覆沒”。因為考題沒有外泄,所以是在比賽後做的,你怎麼知道訓練團隊是否在這時間差來了點額外訓練?相同條件從何談起。 兩個月前,我給ChatGPT和DeepSeek出了一道當年非常著名,但不算很難的立體幾何題目。兩“人”都錯了,DeepSeek還錯的非常離譜。 這道題當年非常著名,當今世界,知道的人已經極少。我曾經請一位搜索高手教我他會怎麼找,他也用了四五步才間接找到。很顯然,兩位AI大概率沒受過這方面訓練。由此,再加上上面時間差的疑問,我對OpenAI的傑出表現相當懷疑。 上面那道題如下。 有一金字塔,塔底正方形邊長為1。四個三角形是正三角形,邊長也是一。 有一正四面體,即四個面都是正三角形,邊長也是一。 把金字塔的一個三角形和正四面體的一個三角形合在一起,問新的多面體有幾個面。 考試委員會的“標準答案”是7,正確答案是5,ChatGPT答7,DeepSeek答8。我不知道OpenAI是何方神聖,有該軟體的讀者不妨測試一下。 有了這個經驗,我對眾多AI的全軍覆沒就毫不驚訝了。再考慮到文中語焉不詳的“相同條件”,我對OpenAI的金牌的懷疑也就順理成章了。
|