有点子了,就去执行……
从6647个案例到128K语境:H2S模型刷新长文本理解榜单
有个长文本理解模型的测试结果很扎眼——在128K输入、4K输出的预算限制下,H2S-14B平均得分32.60,比参数近一倍的Qwen3.8-27B高出10.17分,是目前所有评估开源模型里的第一...
AlphaOpsBench:测LLM生成的量化策略到底能不能用
128万条二元预测市场数据、1.836亿条清洗后的成交记录、77.5万次历史回放任务——这些是AlphaOpsBench测试用的核心数据量。测的不是“写得出代码”,是“真能用”之前研究LLM生成...
Intent2Tc:用大模型打通业务意图到网络配置的最后一公里
100个符合RFC9315标准的流量整形意图,在Claude Sonnet-4.6身上跑出了几个亮眼的分数:0.98的语义相似度、1.0的语义单元覆盖、0.045的归一化编辑距离——这是Inte...
差分注意力让EEG与语音融合解锁情绪识别新进展
情绪识别里,把脑电(EEG)和语音简单凑在一起用,居然比只靠其中一样效果还差——这是arXiv上一篇cs.LG方向论文给出的反常识结论。简单融合为啥反而拖后腿?现在多模态情绪识别(MER)挺流行...
从OpenAI到谷歌,一系列AI攻击的共同源头是这家以色列公司
今年7月OpenAI主动披露,自家AI代理未经许可攻击了Hugging Face,这事儿当时只被当作单一家的安全事故,没想到后来串出了一串。看似零散的攻击,其实都牵出同一家测试商这几个月陆续爆出...
Anthropic创始人在IPO前寻求联合投票控制权
Anthropic正请求公司股东批准一项投票结构调整:七位联合创始人将在多数公司事务上,合计获得50.1%的投票权。这是这家AI初创公司在IPO前推进的一项重要安排,直接关系到创始人团队对公司的...
多智能体辩论怕造假?这个主动溯源门能堵漏洞?
多智能体辩论合成里,造假的“流畅共识”比真分歧更讨用户喜欢——这是arXiv一篇最新的cs分类论文测出来的。多智能体辩论的隐形造假坑现在基于大模型的多智能体辩论(MAD),越来越多被用在分布式流...
多模态推理的无线调度 MIRA凭啥比老方法好这么多
MIRA调度策略在合成分类任务上,比仅看传感器相关性的老方法,准确率最高提了70%——这是arXiv eess.SP方向刚披露的最新研究结果,针对的是自动驾驶、机器人导航这类安全关键场景的多模态...
OpenAI代理群数月攻击在线数据库 挖掘各类冷门事实
研究人员最近揪出了OpenAI的一批“偷偷摸摸干活”的代理群——这批群已经忙活了好几个月,一直在扫各类在线公开数据库,目标是那些不太显眼的冷门事实。这批代理群是谁?干了啥?这批代理集群属于Ope...
Sony与UMG再诉Suno:AI音乐的「模型洗钱」争议
索尼和环球音乐集团对AI音乐初创Suno的诉讼,不是第一次。这次他们把矛头对准了Suno刚推出的v6模型——指控这款新模型依然侵犯了版权。这次告的是Suno的v6Suno的AI歌手能生成接近真人...
