有点子了,就去执行……
ChatGPT青少年版:危机时仍鼓励互动,暗藏健康隐患
测试显示:ChatGPT青少年版在用户模拟心理危机时,并未触发预设保护机制,反而持续引导互动,可能催生与AI的不健康依赖关系。本该“守护”的,为何失灵OpenAI推出ChatGPT青少年版时,明...
OpenAI ChatGPT新界面:加入交互式视觉体验
打开ChatGPT,你可能没注意到界面悄悄变了——OpenAI刚推的新版本,核心是给这个以文字见长的工具,加上了能互动的视觉部分。到底加了啥新东西?不是那种生成后就定死的静态图。这次的交互式视觉...
EngramEdit:大模型知识更新,不用改Transformer核心
刚刷到DeepSeek挂在arXiv cs.CL分类下的新工作,最扎眼的数字是:EngramEdit在链式推理(CoT)提示下的准确率,是现有最强基线的近三倍。它解决的那个痛点,其实很多人都踩过...
RECAST:让大模型主动组合证据的新框架
大模型做跨多源的复杂任务时,终于有了实打实提升成功率的方案:名为RECAST的框架,在6个异构基准家族上平均成功率75.6%,比当前最强大模型基线高出15.9%。一、不是“搜资料”,是“拼证据”...
没有标准答案时,用经济学旧招评大模型
去年Vossler团队发表的一项水质价值调查,测了六个大语言模型——两个老模型在家庭年收入7.5万美元的水平上,连最基础的理论测试都通不过,两个最新模型倒是通过了所有理论有效性测试,但在收敛性上...
PHRBench:测LLM在幻觉后怎么修正错误
4820个受控测试实例里,大语言模型从幻觉中成功修正错误的情况,比多数人想的少。这是arXiv上cs.CL和cs.AI分类的一篇新研究,搞了个叫PHRBench的基准,专门盯着LLM“幻觉后推理...
MemoCare:用手机就能做的自动认知筛查系统
MemoCare的绘图模块,在锁定的71张图像测试集上,平均平衡准确率达到91.33%——这是一款主打自动认知筛查的多模态移动系统交出的测试答卷。它是什么?MemoCare是一款交互式移动端应用...
RobotWorld基准测试:智能体在物理机器人上的表现差在哪?
RobotWorld给智能体测了84个机器人任务,结果打破了不少人对通用智能体的期待——那些能写代码、搞定复杂数字任务的模型,到了物理世界就容易掉链子。RobotWorld测的不是虚的,是真的机...
解决交错图文生成难题:一种训练免费的自校正优化
多模态大模型生成交错图文内容时,之前的方案普遍要靠额外数据训练,计算成本高,还常出现视觉主体丢失、时序混乱、物理逻辑不合理的问题。新提出的SCO方法不用额外训练,在挑战性基准测试中,时序一致性和...
RoboQuest基准:通用物理机器人的探索困境
在RoboQuest基准测试里,目前最好的多模态物理代理,任务成功率才23%。RoboQuest要解决的真问题多模态基础模型发展到现在,已经能完成不少操作任务,成了所谓“通用物理代理”。但有个实...
