星光澄海 | BLOG
有点子了,就去执行……
模型说谎时,推理token数会莫名变多?
三个主流推理型大模型,答完210道覆盖多类型的选择题,一个容易被忽略的信号被抓出来了——说真话时用的推理token数量,明显比指令说谎、不关心对错的情况少得多。绕开“看不懂的推理链”,找低带宽信...
2026-10-07 0 0 人工智能/应用
解决交错图文生成难题:一种训练免费的自校正优化
多模态大模型生成交错图文内容时,之前的方案普遍要靠额外数据训练,计算成本高,还常出现视觉主体丢失、时序混乱、物理逻辑不合理的问题。新提出的SCO方法不用额外训练,在挑战性基准测试中,时序一致性和...
2026-10-07 0 0 人工智能/应用
RoboQuest基准:通用物理机器人的探索困境
在RoboQuest基准测试里,目前最好的多模态物理代理,任务成功率才23%。RoboQuest要解决的真问题多模态基础模型发展到现在,已经能完成不少操作任务,成了所谓“通用物理代理”。但有个实...
2026-10-07 0 0 人工智能/应用
爱沙尼亚语文档简化:大模型表现差距明显
正文:爱沙尼亚语是种形态极其复杂的低资源语言,直到最近,它的文档级文本简化研究几乎是空白——这是一篇cs.CL分类的arXiv论文抛出来的事实。研究到底测了啥?文档级文本简化和改单个句子完全两码...
2026-10-07 0 0 人工智能/应用
TaoD2C-Bench:测MLLM UI代码生成,不止看视觉
2861个来自17家商业平台的真实UI生产设计,97652条专家标注,这是刚在arXiv公开的TaoD2C-Bench基准数据集的全部家底——它专门测多模态大模型(MLLM)的UI代码生成能力,...
2026-10-07 0 0 人工智能/应用
MultiFly:首个低空无人机多模态感知标注基准
115张手工标注的RGB图像,换来了17000多份多模态数据的帧级语义标注——这是刚公开的MultiFly数据集交出的核心成绩。多模态标注的老问题之前做低空无人机感知的,谁没为标注愁过?RGB、...
2026-10-07 0 0 人工智能/应用
Open-MMUnlearning:统一多模态大模型遗忘的方法与评估
最近arXiv上挂出的Open-MMUnlearning框架,把多模态大模型(MLLM)遗忘领域的混乱,给梳理出了清晰的脉络——这个开源项目覆盖5个基准、8个模型家族、12种遗忘方法。为什么ML...
2026-10-07 0 0 人工智能/应用
针对恶意微调的新防御:SLDR的效果与思路
Llama3.1做SST2任务时,用新防御方法SLDR把平均有害输出分从11.54压到了0.08,合法任务的准确率一点没掉——这是它刚在arXiv放出的实测结果。恶意微调的隐形漏洞现在很多人用微...
2026-10-07 0 0 人工智能/应用
大模型生成开源电化学多物理模型,误差不到0.7%
同样的CO₂还原制CO的电化学反应模型,大模型写的开源代码,和COMSOL专业软件的结果差不到0.7%的峰值部分电流密度。测试场景与可复现性这次的测试选得很具体:一维电化学CO₂还原成CO的过程...
2026-10-07 0 0 人工智能/应用
情感分析的共识缺口:人、工具、大模型各说各话
拿100条推文找6个人评情感,结果发现就算是人,对情绪的判断也只处于“一般一致”水平——这是arXiv上一篇cs.CL分类的研究刚捅破的窗户纸。研究专门测了人和工具对社交媒体文本的情感判断一致性...
2026-10-07 0 0 人工智能/应用