当一名研究员说“这个模型还不能发布”,公司要认真考虑失去他的代价;当一支安全团队要求补做测试,管理层也很难把他们简单替换掉。技术判断之所以能进入决策,不只因为它正确,也因为做出判断的人很难被替代。
三十年来,在线广告始终建立在一个默认前提之上:广告位先存在,拍卖再决定谁获得它。 搜索结果的名次、信息流中的哪一次展示,都是预先定义好的机会。但大模型的回答是逐字生成的:某个品牌是否适合出现、在哪里出现、用什么方式介绍,都取决于前面已经写了什么。甚至先谈价格或是先谈体验,都可能为产品造成完全不同的印象。
据The Information爆料,OpenAI正在开发更直接对标Grok Bot的功能,内部也在讨论如何应对Meta的个人助手Muse。 你的ChatGPT里,可能马上就要多出一个「人」了! 马斯克的Bot上班一个多月,扎克伯格的Muse冲上App Store 榜首,一家邀请制小公司谈到了100亿美元估值。 短短几周,在「AI替人干活」这个赛道上,OpenAI一下成了追赶者。 据The Inf ...
如今,Claude 5.5的亮相,直接把新一轮模型大战的火药味儿直接拉满。 目前,Claude Opus 5.5已在全球正式上线,未来几周,Sonnet 5.5与Haiku 5.5也将同步登场。 Artifical Analysis上,Claude 5.5和Fable 5.1,全部压过了GPT-6 Astra ...
Karpathy 对此评论称,Jev 处在大语言模型帕累托最优曲线上的一个位置,满足了一类长期被低估的需求,这类任务不要求模型展开复杂思考,只需输出单个 token,在低延迟条件下完成足够可靠的判断。
外媒The Information曝出内幕——OpenAI内部的AI模型,已经开始「自己训练自己」了! 就在今天,外媒The Information曝出内幕—— OpenAI内部的AI模型,已经开始「自己训练自己」了! 具体来说,这个内部模型已经接管了实验性AI模型的训练全流程,开始自己手搓自己。 研究员只要给出一个优化示例,AI就能自己跑上几个星期,多智能体自发协作,互相讨论,迭代代码,完全不需 ...
1. 套上GrokBuild框架,Grok 4.7飙到56分,排在Fable 5.1、GPT-6 Astra和Opus 5之后。马斯克口中的「全球第三」,是偷偷把Anthropic的两个模型并成了一家。 2. 换到统一基准的Terminal-Bench4.0后,Grok 4.7的通过率当场暴跌到26%~27%。作为对比,GPT-6 Astra是60%,Fable 5.1是55%。
今天早上,OpenAI 宣布与一个独立数学顾问组合作。该组织名为「数学与人工智能顾问组」(Advisory Group on Mathematics and Artificial Intelligence,AGMAI),由普林斯顿高等研究院托管。它眼下的一项任务,是针对 OpenAI 内部模型产生的大量数学结果,就评估、审查和发布方式提出建议。
macOS平台的Meta Muse AI Agent存在一处0Day漏洞。若用户设备上已有恶意软件在当前账户权限下运行,就可借助该漏洞劫持Muse助手。 攻击者可以拦截用户语音输入的提示词,向Muse注入恶意指令。除此之外,攻击者还能窃取用户的账户认证凭证。
黄仁勋对AI末日论的反驳很强硬,他提出的替代方案却很朴素:把AI当成产品,把风险当成工程,让公司为自己交付的系统负责。 这套回答不能证明AI永远不会发生更大的风险,也不能用现有法律一句带过所有新问题。但它让开发者暂时离开了“人类还剩几年”的猜测,回到手边可以检查的系统。
哪道题值得先看?哪道要拆开重写?找谁来核对?署谁的名字?OpenAI把这些脏活累活全丢给了9个不拿工资的大神,而把疯狂刷题的引擎油门,死死攥在了自己手里。
开源的Laya冒了出来。它有421M参数,大约是4.2亿,采用Apache 2.0协议。Laya自称单问题延迟低了近8倍。在它自己公布的typed-decisions测试集上,专用微调checkpoint的准确率达到0.766,高于其中对比的Jev 1.13.0的0.727。 9月15日,前OpenAI研究员创办的TypeSafe AI拿出了隐身两年打磨的Jev。这个模型主打"只做决策、不说话", ...