OpenAI新模型展现“AI Agent”潜力,Cursor AI客服“幻觉”暴露风险
创始人
2025-04-23 04:41:14
0

一、OpenAI智能代理获好评,身份验证程序引争议

OpenAI o3和o4-mini模型在上周发布, 开发者对新模型的反应值得关注。

▲OpenAI不同模型的指令遵循和代理工具使用对比数据

开发者说,OpenAI新一代推理模型正逐步成为对终端用户和开发者更有实用价值的“AI Agent”,这与前几代产品形成鲜明对比。此前版本被批评为仅能在封闭环境中快速解决数学问题的“超智能AI”。新模型的突破在于能够调用外部工具和应用程序,为用户提供端到端的任务处理能力,包括在编写复杂功能时在线搜索文档,以及为用户制定带有学习提醒的课程计划等。

最令开发者们印象深刻的能力还是其对图像相关问题的解答。在一个颇具代表性(同时也令人担忧)的案例中,用户向AI提供食物照片或普通风景照,要求模型推测拍摄地点,其准确率之高令人意外。

▲OpenAI o3模型图像识别功能演示图

当然,这些模型仍存在缺陷。它们在某些相对简单的问题上仍会出错,部分用户反映模型在解决问题时会未经提示就使用用户姓名,这种行为令人不适。

引发开发者争议的改动是通过API接口获取o3模型时新增的“身份验证”流程。据开发者透露,该流程要求用户上传政府签发的身份证件照片及面部识别视频。OpenAI此举可能旨在防止用户创建大量虚假账户获取o3模型输出数据,用于训练其他AI模型(即“模型蒸馏”技术)。但部分用户认为这一措施带有“监控”色彩,对向OpenAI提供个人数据表示担忧。

二、Cursor的AI客服编造登录政策,投诉声音高涨

目前看来,AI初创公司还算幸运,尚未出现过太多令人尴尬的AI事故。不过最近,首个因AI失误而让热门AI初创公司陷入困境的例子似乎出现了。

上周,一些开发人员注意到,Anysphere旗下热门AI编程助手Cursor存在一个问题:当他们试图从第二台电脑登录时,系统会将他们强制登出。 这对于需要在多种设备上测试网站或应用程序的开发者来说是个严重的困扰。

当开发人员向Cursor的支持邮箱反映这一问题时,他们收到了该公司AI客服代理的回复,称这是Cursor新登录政策下的正常行为。 但问题在于,根本不存在这样的登录政策, 这是客服机器人编造出来的,也就是所谓的“AI幻觉”。

▲Cursor AI客服回复截图

这一事件引起了许多开发者在社交媒体上投诉,有些人甚至表示已经因此取消了订阅。

其实在事件发生后,交流过的大多数开发者客户都认为这不是件大事,他们也承认这类错误在使用任何初创公司的产品时都难以避免。但这确实给企业上了一课:不要在没有任何人工核实的情况下过于依赖AI产品。

开发人员说,这起事件对Cursor使用的客服代理服务提供商的影响要比对Cursor本身的影响大得多。这不禁让人好奇Cursor使用的是哪家客服公司,特别是考虑到这类客服机器人之所以能够成为对话式AI最早普及的应用之一,部分原因就在于它们的风险较低。

不过,在AI时代,客服的风险可能会越来越大,如今客户更换供应商是一件非常容易的事。这一点在AI编程市场尤为明显,因为即使是像新模型发布或编码助记忆信息量调整这样的微小变动,都能迅速使开发者转向新产品。这种情况让新兴编程初创公司更容易崭露头角,比如针对非技术开发者的StackBlitz或Lovable以及像Cline这样的开源方案。

Cursor或许目前暂时占据了编程领域的宝座,但它最好能让客户保持满意(尤其是在其主要竞争对手Windsurf似乎可能与OpenAI合作的情况下)。

结语:用户体验是AI产品生存与发展的重要指标

OpenAI新发布的o3和o4-mini推理模型凭借其实用性获得开发者广泛好评,尤其是其图像识别与跨工具任务处理能力,为“AI Agent”概念赋予了新内涵。然而,新增的身份验证流程因涉及用户隐私与数据安全争议,引发部分开发者对技术监控的担忧,凸显出用户对隐私保护与信任机制的高度敏感。

与此同时,Cursor的AI客服因编造登录政策导致用户投诉激增,暴露出人工智能在客户服务场景中的“幻觉”风险。尽管多数开发者认为此类问题在初创企业产品中难以避免,但事件仍为行业敲响警钟:过度依赖AI而缺乏人工核验机制,不仅可能直接损害用户信任,更可能因服务失误导致用户流失。

决定AI产品生命力的不仅是技术参数的高低,更是每一个真实用户的使用感受。在AI技术快速迭代的当下,AI创新若不能以优质的用户体验为基础,或许将难以获得市场的持久认可。

来源:The Information

相关内容

热门资讯

宁波朗迪取得网布烫边切割装置专... 金融界2025年8月6日消息,国家知识产权局信息显示,宁波朗迪环境科技有限公司取得一项名为“网布烫边...
富兴塑膜取得PVC塑膜压纹成型... 金融界2025年8月6日消息,国家知识产权局信息显示,苍南县富兴塑膜有限公司取得一项名为“一种PVC...
美国拟2030年前在月球建成核... △艺术家描绘的月球上的电力系统。(图片来源:NASA) 当地时间8月5日,据多家美国媒体报道,美国交...
TTG3-1KSG,清清正反手... TTG3-1战胜KSG,终于结束了对KSG的连败。从EWC回来之后他们似乎变强了,清清证明了为什么萝...
中国电信视联网赋能基层治理 提... 近日,丰都县仁沙镇依托中国电信视联网技术,进一步提升基层治理智能化水平,推动乡村基层治理体系不断完善...
《上古OL》开发商被砍掉的《黑... 微软最近的大裁员砍掉了《上古卷轴OL》开发商备受期待的新IP(代号为黑鸟计划)以及Rare工作室的《...
山东科嘉电气:高效智能充电方案... 山东科嘉电气近日推出了两款创新充电设备,专为不同领域提供专业、高效、安全的充电解决方案。这些设备分别...
科技前沿丨普通家庭何时能用上保... 7月31日召开的国务院常务会议审议通过《关于深入实施“人工智能+”行动的意见》。会议指出,当前人工智...
泰科汽车取得油箱加油单向阀专利... 金融界2025年8月6日消息,国家知识产权局信息显示,芜湖泰科汽车科技有限公司取得一项名为“一种油箱...
当年吹爆Edge浏览器的我,现... 每位资深玩家,在对枪失败、团战暴毙后,都有一套神圣的仪式: “诶今天鼠标有点飘”、“这键盘键程不对”...
走出光伏同质化困境,BC生态圈... 来源:澎湃新闻 隆基绿能创始人、首席技术官李振国 同质化的红海厮杀,令光伏产业深陷恶性竞争泥潭。乘...
AL被打晕了?IG辅助抢大龙翻... ★游戏马蹄铁原创 AL对战IG第二局 IG无愧是现在LPL的人气王,流量王,他们的比赛不仅是明星选...
LOL:BLG被曝不是全华班,... Shadow护照是意大利的 在LPL赛区中,全华班自带流量和话题,像RNG、BLG这种主打全华班的...
紧盯AI人才,“鹅厂”招新,软... 8月6日,腾讯2026校园招聘正式启动。本次招聘面向2025年1月至2026年12月期间毕业的大学生...
DOTA2 7.39d 更新深... 当看到 7.39d 的更新日志时,我的第一反应是:这不是简单的数值微调,而是V社对当前版本生态的一次...
《仁王3》制作人访谈:保留硬核... 今年6月,《仁王3》发布了首支预告片,并宣布游戏将于明年年初正式发售,登陆PlayStation 5...
青春好市 | 以手抵心,对话千... 当棕榈叶在指尖翻飞成灵兽,当大漆在掌心打磨出光华,当破碎的古瓷片在你手中重获新生...这不是遥远的传...
IDC:Q2中国消费级游戏本市... IT之家 8 月 6 日消息,市场研究机构 IDC 今天发文,披露了中国消费级游戏 PC 市场的数据...
小米手机欧洲市场份额首超苹果,... 【太平洋科技快讯】8 月 6 日,小米集团合伙人、小米集团总裁、部总裁兼小米品牌总经理卢伟冰在社交媒...
王者荣耀:夏侯惇喜迎加强,亚连... 王者荣耀本赛季已经进入中期,还没有拿到王者印记的小伙伴确实该抓紧时间了,毕竟到了赛季后半段上分难度会...