星光澄海 | BLOG
有点子了,就去执行……
OmniCapBench:解决多模态模型评测痛点的新框架
你知道现在评测多模态大模型(MLLM)有多挠头吗?要么评分全但找不到具体问题在哪,要么能定位但覆盖不全,用大模型当裁判又容易乱打分。直到OmniCapBench出来——它靠786个精标视频,把评...
2026-10-08 1 0 人工智能/应用
扩散模型的控制级不确定性:SCOPE解决采样成本痛点
机器人做实时路径规划时,用扩散模型生成轨迹,之前算不确定性要靠蒙特卡洛采样,这一步慢到跟不上毫秒级的控制需求。原来的问题:扩散模型的不确定性太“贵”扩散模型能表示复杂多变的多模态轨迹分布,但要从...
2026-10-08 1 0 人工智能/应用
FastBench测流式VLMs:高速现实流感知卡壳了?
目前最强的Gemini-3.5-Flash,在FastBench测试里只拿了50.7分——这是当前流式视频大模型(VLM)应对高速现实流感知的上限,连及格线都没摸到。原有基准的盲区:1-2FPS...
2026-10-08 1 0 人工智能/应用
统一多模态深度研究Agent OneSearch-VL 做对了什么
OneSearch-VL-8B比带工具调用的Qwen3-VL-8B,在两个新的多模态视觉基准上,分别高出20.2和17.6个百分点。同参数级别的模型,差十几个点已经是很明显的能力差距——这不是小...
2026-10-08 1 0 人工智能/应用
WOVEN:补上多模态大模型的视觉推理短板
38个顶尖多模态大模型里,没一个能达到人类的视觉推理水平。多模态大模型的集体硬伤多模态大模型(MLLMs)在空间、具象化、物理、时间推理上表现极差。研究人员发现这些失效其实指向同一个核心问题:视...
2026-10-08 1 0 人工智能/应用
GeoReform如何帮大模型搞定几何题?
Geometry3K数据集上,多模态大模型做几何题的准确率,之前只有42%。换了叫GeoReform的框架后,直接涨到56%。但你知道吗?之前有人试过另一种解法,在200个例子里,改了28个几何...
2026-10-08 1 0 人工智能/应用
大模型说的法律依据,算不算真的依据?
说出来你可能不信:7个从80亿到700亿参数的开源大模型,在法律推理里,说对法条或判例的概率能达到66.7%到100%;但你要是偷偷把它们引用的法条换成不相关的,它们的判决结果能跟着变的比例,最...
2026-10-08 1 0 人工智能/应用
突破长尾分布前置障:大模型SFT的自适应新方法
一篇arXiv上归类为cs.AI、cs.CL、cs.LG的论文,给出了一组可量化的实验结论:他们提出的PASS自适应SFT指令选择法,在4种不同主干模型+预算组合的测试场景里,连续超越7种当前最...
2026-10-08 1 0 人工智能/应用
VFold:让LLM长上下文缓存省内存还不拖速度
LLM跑长上下文时,内存压力常卡脖子。很多人可能没意识到——这压力主要不是来自模型参数,是KV缓存。解码时每一层的KV状态都得存下来,上下文越长,这部分占内存的比例越高。现在的压缩方案,大多踩了...
2026-10-08 1 0 人工智能/应用
神经网络调优:大模型靠初始设定还是实验反馈?
在神经算子调优任务里,大模型的留集测试nRMSE,几乎在所有对比里都比随机搜索、贝叶斯优化更低。这是arXiv上一篇归类于cs.AI、cs.LG、physics.comp-ph的论文,针对“大模...
2026-10-08 1 0 人工智能/应用