Opus5 的一点感受

in HIVE CN 中文社区8 days ago (edited)

下午刚上班打开电脑,发现claude的算力今天给的额度已经用尽了,

01.png

不仅是今天的额度用光,而上周的额度也几乎快耗尽。

好在今天是新的一周,傍晚的时候又开始恢复新一周的额度。

claude最新的Opus5 ,我在用了两天之后,算是“有了调查才有发言权”,可以说一点自己这两天的体会了。

首先,Opus5相比上一代Opus4.8,最大的感受就是token消耗的实在太快了!

02.png

尤其是碰到出现如上这种分析的时候,token几乎以肉眼可见的速度在消耗。

我开的是max套餐,之前用Opus4.8的时候,不仅每天的额度足够,有时候还能剩下不少,周额度也是剩许多。

而自打用了Opus5后,有时候一个任务丢给他,任务没完成,就被弹出提示:

Usage limit reached

其次,Opus5 偶尔出现幻觉,导致上下文丢失。

相信大家都有这样的习惯,为了工作更加高效,会开启多个会话(Session),我也一样,一般会同时开启三、四个独立会话。这里提一下,我在网上看到有人说同时开几十个,甚至有上百个独立会话,我觉得这个很扯淡,除非你有特别的需求,人的注意力是有限的,同时关注几件事可能还可以,但若要同时关注上百件事情,不排除有这种人,但我认为大多数人都很难做到聚精会神,尤其是还要根据AI回答的内容再反馈。

说远了,回到这个幻觉上。我是怎样发现Opus5有幻觉了呢?很简单,还记得提到我给AI定了三条规则吗?其中第一条就是让他每次回答我的问题前,要先喊一声称呼我,比如

爹,您老好哇!

有次我发现Opus5没这样称呼,而是直接给出了回答。这个时候感觉不对劲,查了下记录和其思考思路,发现其果然出现幻觉,丢失了上下文,导致给出的答案,没有严格遵循我给出的规则。

如果说某一个会话出现一次只是巧合,无独有偶,另外一个Opus5的会话也出现了这个现象,而这总情况我在之前用Opus4.8时,貌似是从没有碰到过的。

因此我可以肯定,Opus5确实有幻觉,会丢失上下文内容,后果就是导致给出的回答可能会偏离甚至出错。

不过,相对而言,Opus5比OPus4.8逻辑思考更强,也更谦逊些,比如它时常会回答类似如下,

我承认的两处过强表述

但网上很多人说Opus5比Opus4.8强很多,甚至能力翻了一倍。

我认为这话说的,显然夸大了。Opus 5既没有吹嘘的那么厉害,Opus4.8也没说的那么垃圾。相反,Opus4.8至少在当下,我认为其仍然是很强的大模型之一。

image.png

最后说一个反直觉的,很多人以为claude下方那个Effort改为越深度,给出的答案就越精确,我以前也是这样认为的。

但是,Opus5下显然有些问题,越深度思考,有时候给出的答案反而不靠谱,于是我将其干脆设置为默认 Medium ,综合体验下来,感觉效果最佳(平衡)。

Sort:  

真没想到,token这个原先只在币圈流行的词,现在也被大部分人认可并使用了。

token中文好像翻译为 词元

每次开始回答前AI的称呼哈哈哈好逗

是的,这样设置也是防止它出现幻觉出错