2022 年底,在 AI 开始成为技术圈高频话题之后,崔皓逐渐把自己的重心从 Java、MySQL、RabbitMQ 等技术课程转向 ChatGPT、LangChain 等 AI 技术。他持续做课程、写书、做企业培训和项目,也越来越多地把 AI ...
43分钟、11138个推理token、6批指令——0个作战单位。这是Grok 4.6在《星际争霸:母巢之战》里交出的一张绝望成绩单。 想太多,就连最聪明的AI也会被拖死。 43分钟、11138个推理token、6批指令——0个作战单位。 这是Grok 4.6在《星际争霸:母巢之战》里交出的一张绝望成绩单。 游戏中,把推理拉到最高档位xhigh的Grok,从开局苦思冥想到游戏结束,硬是连一个能上场打 ...
当一名研究员说“这个模型还不能发布”,公司要认真考虑失去他的代价;当一支安全团队要求补做测试,管理层也很难把他们简单替换掉。技术判断之所以能进入决策,不只因为它正确,也因为做出判断的人很难被替代。
据The Information爆料,OpenAI正在开发更直接对标Grok Bot的功能,内部也在讨论如何应对Meta的个人助手Muse。 你的ChatGPT里,可能马上就要多出一个「人」了! 马斯克的Bot上班一个多月,扎克伯格的Muse冲上App Store 榜首,一家邀请制小公司谈到了100亿美元估值。 短短几周,在「AI替人干活」这个赛道上,OpenAI一下成了追赶者。 据The Inf ...
如今,Claude 5.5的亮相,直接把新一轮模型大战的火药味儿直接拉满。 目前,Claude Opus 5.5已在全球正式上线,未来几周,Sonnet 5.5与Haiku 5.5也将同步登场。 Artifical Analysis上,Claude ...
三十年来,在线广告始终建立在一个默认前提之上:广告位先存在,拍卖再决定谁获得它。 搜索结果的名次、信息流中的哪一次展示,都是预先定义好的机会。但大模型的回答是逐字生成的:某个品牌是否适合出现、在哪里出现、用什么方式介绍,都取决于前面已经写了什么。甚至先谈价格或是先谈体验,都可能为产品造成完全不同的印象。
Karpathy 对此评论称,Jev 处在大语言模型帕累托最优曲线上的一个位置,满足了一类长期被低估的需求,这类任务不要求模型展开复杂思考,只需输出单个 token,在低延迟条件下完成足够可靠的判断。
外媒The Information曝出内幕——OpenAI内部的AI模型,已经开始「自己训练自己」了! 就在今天,外媒The Information曝出内幕—— OpenAI内部的AI模型,已经开始「自己训练自己」了! 具体来说,这个内部模型已经接管了实验性AI模型的训练全流程,开始自己手搓自己。 研究员只要给出一个优化示例,AI就能自己跑上几个星期,多智能体自发协作,互相讨论,迭代代码,完全不需 ...
macOS平台的Meta Muse AI Agent存在一处0Day漏洞。若用户设备上已有恶意软件在当前账户权限下运行,就可借助该漏洞劫持Muse助手。 攻击者可以拦截用户语音输入的提示词,向Muse注入恶意指令。除此之外,攻击者还能窃取用户的账户认证凭证。
哪道题值得先看?哪道要拆开重写?找谁来核对?署谁的名字?OpenAI把这些脏活累活全丢给了9个不拿工资的大神,而把疯狂刷题的引擎油门,死死攥在了自己手里。
1. 套上GrokBuild框架,Grok 4.7飙到56分,排在Fable 5.1、GPT-6 Astra和Opus 5之后。马斯克口中的「全球第三」,是偷偷把Anthropic的两个模型并成了一家。 2.
开源的Laya冒了出来。它有421M参数,大约是4.2亿,采用Apache 2.0协议。Laya自称单问题延迟低了近8倍。在它自己公布的typed-decisions测试集上,专用微调checkpoint的准确率达到0.766,高于其中对比的Jev 1.13.0的0.727。 9月15日,前OpenAI研究员创办的TypeSafe AI拿出了隐身两年打磨的Jev。这个模型主打"只做决策、不说话", ...