谷歌在经历了七个月的沉默后,于10月1日发布了全新的Gemini 4 Argon模型。这是该公司自上次推出Flash级模型以来,首次推出非Flash专有模型。在Artificial Analysis的智能指数中,Argon获得了53分,与GPT-6 Astra平分秋色,并比GPT-6.1 Sol高出一分,幻觉率降低至15%。该模型在多个基准测试中展现了显著的Agent能力提升,并在网络安全领域的CWE-bench基准测试中并列第一,具备自主发现和验证漏洞的能力。
目前,Argon已经向部分用户推广,支持1M上下文和多模态输入,预计将在模型价格战中占据有利地位。根据首发折扣,用户每完成一个任务的平均费用为1.99美元,约为GPT-6 Astra的60%。尽管价格看似低廉,但任务处理的Token数量可能较高,增加了总费用。
Argon的发布结束了谷歌近七个月的静默期,这款模型较之前的Gemini 3.1 Pro Preview评分提升了23分,超越了Gemini 3.8 Flash。这标志着谷歌重新回到了智能水平前列的实验室之中。虽然智能指数让谷歌成为可与其他先进模型相比的选择,但Argon目前仅向选定用户开放,并未全面推出。
在定价方面,Argon显示出极强的竞争力。目前每百万Token的输入和输出费用分别为2美元和10美元,都是其竞争对手Opus 5.5和Astra的较低价格。尽管如此,Argon每次任务的Token使用量较高,导致成本在某些情况下可能增长。此外,该模型的首发定价是促销优惠,未来的标准价格将远超目前的费用,这可能影响长期用户的决策。
值得关注的是,Argon在处理不熟悉问题时的表现,在幻觉率方面表现突出,高达77.5%的有效率。在实际应用中,虽然它显示出承认未知的能力,减少提供错误答案的尝试,但在准确性测试中,其结果却低于某些竞争对手。综合看来,Gemini 4 Argon的发布在市场上构成了新的竞争局面,让用户在选择模型时有了更多的思考和比较空间。
发表评论