星光澄海 | BLOG
有点子了,就去执行……
不等Gemini4,谷歌新办公Agent支持调用Claude
刚有消息传,谷歌没等Gemini 4正式发布,先悄悄推出了一款面向办公场景的Agent产品,它最受关注的功能之一,是支持调用Anthropic旗下的Claude大模型。不等Gemini 4,谷歌...
2026-10-08 1 0 人工智能/应用
Google把Gemini改成商用AI智能体,还配了专属邮箱
Google给Gemini做了个核心改动——不再是只陪聊的AI,而是面向企业的AI智能体。这次改的核心是什么?它的核心功能是能自己规划任务、执行任务,还能把细分的子任务分给更小的智能体去做。它不...
2026-10-08 1 0 人工智能/应用
Anthropic更新Claude使用政策:明确禁止滥用与选举干预
Anthropic刚更新了Claude的使用政策,其中最明确的一条是:极端情况下反复滥用模型的行为被禁止,但日常对模型的不满、批评仍被允许。新规到底卡了谁?之前不少AI模型的使用规则,常把“滥用...
2026-10-08 1 0 人工智能/应用
OmniCapBench:解决多模态模型评测痛点的新框架
你知道现在评测多模态大模型(MLLM)有多挠头吗?要么评分全但找不到具体问题在哪,要么能定位但覆盖不全,用大模型当裁判又容易乱打分。直到OmniCapBench出来——它靠786个精标视频,把评...
2026-10-08 1 0 人工智能/应用
SpatialHarness补了GPT-6 Astra精细操作的空间短板
给GPT-6 Astra的插针测试,之前成功率才26.7%,用SpatialHarness一上,直接飙到66.7%——汉诺塔更是从0变100%。这不是游戏,是arXiv cs.RO分类里一篇机器...
2026-10-08 1 0 人工智能/应用
给多智能体加个“读心术”:新框架补了协作短板
你可能没注意——现在靠大模型驱动的智能体组队干活,大多是“盲打”状态。普通多智能体的协作硬伤之前的多智能体系统,靠提示词设计、短期记忆或者端到端行为优化推进任务。但核心问题很致命:不会显式建模队...
2026-10-08 1 0 人工智能/应用
统一多模态深度研究Agent OneSearch-VL 做对了什么
OneSearch-VL-8B比带工具调用的Qwen3-VL-8B,在两个新的多模态视觉基准上,分别高出20.2和17.6个百分点。同参数级别的模型,差十几个点已经是很明显的能力差距——这不是小...
2026-10-08 1 0 人工智能/应用
WOVEN:补上多模态大模型的视觉推理短板
38个顶尖多模态大模型里,没一个能达到人类的视觉推理水平。多模态大模型的集体硬伤多模态大模型(MLLMs)在空间、具象化、物理、时间推理上表现极差。研究人员发现这些失效其实指向同一个核心问题:视...
2026-10-08 1 0 人工智能/应用
HRIL用高阶张量抓多模态协同:比现有方法强在哪?
多模态自监督学习已经在好多场景出成果了,但有个死穴:有些任务需要的信号,单看某一个模态根本找不到。比如一张图配一句“猫在追老鼠”,“追”这个动作的核心信号,得同时看猫的身体姿态和老鼠的位置,单拿...
2026-10-08 1 0 人工智能/应用
GeoReform如何帮大模型搞定几何题?
Geometry3K数据集上,多模态大模型做几何题的准确率,之前只有42%。换了叫GeoReform的框架后,直接涨到56%。但你知道吗?之前有人试过另一种解法,在200个例子里,改了28个几何...
2026-10-08 1 0 人工智能/应用