澎湃Logo
下载客户端

登录

无障碍
  • +1

大模型智障检测+1:Strawberry有几个r纷纷数不清,最新最强Llama3.1也傻了

2024-07-25 17:02
来源:澎湃新闻·澎湃号·湃客
字号

梦晨 一水 发自 凹非寺

量子位 | 公众号 QbitAI

继分不清9.11和9.9哪个大以后,大模型又“集体失智”了!

数不对单词“Strawberry”中有几个“r”,再次引起一片讨论。

GPT-4o不仅错了还很自信。

刚出炉的Llama-3.1 405B,倒是能在验证中发现问题并改正。

比较离谱的是Claude 3.5 Sonnet,还越改越错了。

说起来这并不是最新发现的问题,只是最近新模型接连发布,非常热闹。

一个个号称自己数学涨多少分,大家就再次拿出这个问题来试验,结果很是失望。

在众多相关讨论的帖子中,还翻出一条马斯克对此现象的评论:

好吧,也许AGI比我想象的还要更远。

路遇失智AI,拼尽全力终于教会

有人发现,即使使用Few-Shot CoT,也就是“一步一步地想”大法附加一个人类操作示例,ChatGPT依然学不会:

倒是把r出现的位置都标成1,其他标成0,问题的难度下降了,但是数“1”依旧不擅长。

为了教会大模型数r,全球网友脑洞大开,开发出各种奇奇怪怪的提示词技巧。

比如让ChatGPT使用漫画《死亡笔记中》高智商角色“L”可能使用的方法。

ChatGPT想出的方法倒是也很朴素,就是分别把每个字母写出来再一个一个数并记录位置,总之终于答对了。

有Claude玩家写了整整3682个token的提示词,方法来自DeepMind的Self-Discover论文,可以说是连夜把论文给复现了。

整个方法分为两大阶段:先针对特定任务让AI自我发现推理步骤,第二阶段再具体执行。

发现推理步骤的方法简单概括就是,不光要会抽象的思维方法,也要具体问题具体分析。

这套方法下,Claude给出的答案也非常复杂。

作者补充,花这么大力气解决“数r问题”其实并不真正实用,只是在尝试复现论文方法时偶然测试到了,希望能找出一个能用来回答所有问题的通用提示词。

不过很可惜,这位网友目前还没公布完整的提示词。

还有人想到更深一层,如果要计算文档中straberry出现多少次怎么办?

他的方法是让AI想象有一个从0开始的内存计数器,每次遇到这个单词就往上加。

有人评论这种方法就像在用英语编程。

也有AI可以一次做对

那么究竟有没有大模型,可以不靠额外提示词直接答对呢?

其实不久之前有网友报告,ChatGPT是有小概率能直接答对的,只不过不常见。

谷歌Gemini 大概有三分之二的概率能答对,打开“草稿”就能发现,默认每个问题回答三次,两次对一次错。

至于国内选手,在提问方式统一、每个模型只给一次尝试机会的测试下,上次能正确判断数字大小的,这次同样稳定发挥。

字节豆包给出了正确回答,还猜测用户问这个问题是要学习单词拼写吗?

智谱清言的ChatGLM,自动触发了代码模式,直接给出正确答案“3”。

腾讯元宝像解数学题一样列方程给出了正确答案(虽然貌似没有必要)。

文心一言4.0收费版则更加详细,也是先正确理解了意图,然后掰指头挨个找出了全部的“r”。

不过有意思的是,在同一种方法下,文心一言APP中的免费版文心3.5掰指头也能数错。

讯飞星火也通过找出“r”所在位置给出了正确回答。

还是token的锅

虽然“数r”和“9.11与9.9哪个大”,看似一个是数字问题一个是字母问题,但对于大模型来说,都是token问题。

单个字符对大模型来说意义有限,使用GPT系列的Llama系列的tokenizer就会发现,20个字符的问题,在不同AI眼中是10-13个token。

其中相同之处在于,strawberry被拆成了st-,raw,-berry三个部分来理解。

换一个思路用特殊字符ⓢⓣⓡⓐⓦⓑⓔⓡⓡⓨ来提问,每一个字符对应的token也就会分开了。

面对这种问题,其实最简单的方法就是像智谱清言一样,调用代码来解决了。

可以看到,ChatGPT直接用Python语言字符串的count函数,就能简单搞定。

刚刚创业开了所学校的大神卡帕西认为,关键在于需要让AI知道自己能力的边界,才能主动去调用工具。

至于教给大模型判断自己知道不知道的方法,Meta在LLama 3.1论文中也有所涉及。

最后正如网友所说,希望OpenAI等大模型公司,都能在下个版本中解决这个问题。

GPT Tokenizer试玩

https://gpt-tokenizer.dev

Llama Tokenizer试玩

https://belladoreai.github.io/llama-tokenizer-js/example-demo/build/

参考链接:

[1]https://x.com/diegoasua/status/1816146114573394143

[2]https://www.reddit.com/r/ClaudeAI/comments/1eap6b1/comment/leolf3t/

[3]https://www.reddit.com/r/ChatGPT/comments/1do7cnq/counting_the_rs_a_chat_with_chatgpt/

[4]https://www.reddit.com/r/ChatGPT/comments/1dpfj2c/a_prompt_where_chatgpt_gets_the_strawberry/

— 完 —

    本文为澎湃号作者或机构在澎湃新闻上传并发布,仅代表该作者或机构观点,不代表澎湃新闻的观点或立场,澎湃新闻仅提供信息发布平台。申请澎湃号请用电脑访问http://renzheng.thepaper.cn。

    +1
    收藏
    我要举报

    玻璃钢生产厂家辉县玻璃钢雕塑厂家吉林玻璃钢传统人物雕塑清远创新型的玻璃钢雕塑玻璃钢仿铜人物雕塑图片商场大厅美陈图片教程夏天商场美陈如何布置邯郸景观玻璃钢卡通雕塑厂家松江区专业玻璃钢雕塑服务至上商场商业美陈包装兴宁玻璃钢景观雕塑玻璃钢雕塑包运费吗玻璃钢雕塑质量怎么区分济南商场玻璃钢雕塑济宁玻璃钢雕塑一手货源2018年西安商场美陈潮州卡通人物玻璃钢造型雕塑西宁市玻璃钢雕塑乐山园林玻璃钢雕塑厂家热卖玻璃钢花盆花器广州商场美陈布置玻璃钢鼠年雕塑昆山百货商场美陈福州玻璃钢雕塑多少钱江苏户外商场美陈供货商青浦玻璃钢雕塑厂玻璃钢墙体彩绘雕塑南阳广场玻璃钢雕塑厂家玻璃钢雕塑如何计算的商场美陈专员工作问题温岭玻璃钢雕塑香港通过《维护国家安全条例》两大学生合买彩票中奖一人不认账让美丽中国“从细节出发”19岁小伙救下5人后溺亡 多方发声单亲妈妈陷入热恋 14岁儿子报警汪小菲曝离婚始末遭遇山火的松茸之乡雅江山火三名扑火人员牺牲系谣言何赛飞追着代拍打萧美琴窜访捷克 外交部回应卫健委通报少年有偿捐血浆16次猝死手机成瘾是影响睡眠质量重要因素高校汽车撞人致3死16伤 司机系学生315晚会后胖东来又人满为患了小米汽车超级工厂正式揭幕中国拥有亿元资产的家庭达13.3万户周杰伦一审败诉网易男孩8年未见母亲被告知被遗忘许家印被限制高消费饲养员用铁锨驱打大熊猫被辞退男子被猫抓伤后确诊“猫抓病”特朗普无法缴纳4.54亿美元罚金倪萍分享减重40斤方法联合利华开始重组张家界的山上“长”满了韩国人?张立群任西安交通大学校长杨倩无缘巴黎奥运“重生之我在北大当嫡校长”黑马情侣提车了专访95后高颜值猪保姆考生莫言也上北大硕士复试名单了网友洛杉矶偶遇贾玲专家建议不必谈骨泥色变沉迷短剧的人就像掉进了杀猪盘奥巴马现身唐宁街 黑色着装引猜测七年后宇文玥被薅头发捞上岸事业单位女子向同事水杯投不明物质凯特王妃现身!外出购物视频曝光河南驻马店通报西平中学跳楼事件王树国卸任西安交大校长 师生送别恒大被罚41.75亿到底怎么缴男子被流浪猫绊倒 投喂者赔24万房客欠租失踪 房东直发愁西双版纳热带植物园回应蜉蝣大爆发钱人豪晒法院裁定实锤抄袭外国人感慨凌晨的中国很安全胖东来员工每周单休无小长假白宫:哈马斯三号人物被杀测试车高速逃费 小米:已补缴老人退休金被冒领16年 金额超20万

    玻璃钢生产厂家 XML地图 TXT地图 虚拟主机 SEO 网站制作 网站优化