星光澄海 | BLOG
有点子了,就去执行……
DVD解码方案:解决多模态大模型感知的效率痛点
在RefCOCO、KITTI、nuScenes等多模态感知基准测试里,一个叫DVD的新解码方案,让多模态大模型(MLLM)在2D和3D感知任务上,既提升了性能,又砍了token开销、降了推理延迟...
2026-10-08 1 0 人工智能/应用
EgoVoice:从第一视角流里主动说话的AR助手
AR助手主动搭话这件事,目前做得特别差。哪怕是零样本的基础模型,也很难踩中你真正需要提示的点——要么早了帮不上忙,要么晚了根本没用。直到arXiv那篇归类在cs.CL、cs.CV、cs.SD的论...
2026-10-08 1 0 人工智能/应用
TokenRouter:让token级LLM路由效率提升2到64倍?
TokenRouter在多种路由算法、工作负载和模型配对下,解码吞吐量是现有系统的2.01到64.15倍——这是arXiv上一篇cs.CL分类的论文给出的实测结果。现存token级LLM路由服务...
2026-10-08 1 0 人工智能/应用
JetBrains推Mellum2.1:12B MoE开源模型瞄准编码智能体
JetBrains刚更的Mellum2.1,把SWE-bench Verified的分数从2.0拉到了47.0——这个提升幅度够让做代码大模型的人眼前一亮。升级的门道:几乎全靠真实代码环境的RL...
2026-10-08 1 0 人工智能/应用
Oracle靠ChatGPT和Codex 把数天工作压缩至几分钟
Oracle在招聘、工程、运营三大核心业务领域,已经把原本需要数天完成的专业工作,靠两款AI工具压缩到了几分钟。三大板块全落地,覆盖多类专业工作不是某一个团队的试点,是全公司级的应用。招聘里的岗...
2026-10-08 1 0 人工智能/应用
量子代码自动迁移:13个基准的实测与启示
把13个量子编程基准从Qiskit换到CUDA-Q,三个大模型各有优劣:有的能省96%的算力消耗,有的得反复催才不踩坑——这是arXiv上一篇quant-ph分类的案例研究,讲的是量子代码自动迁...
2026-10-07 1 0 人工智能/应用
Agentic BBO新基准出炉:LLM优化能力大比拼
为什么要做这个统一基准?之前研究Agentic BBO的各家,选的任务领域不一样,系统配置也不统一,导致结果没法横向比,连哪个设计选择真正起作用都分不清——说白了就是各说各的好,没个准谱。黑盒优...
2026-10-07 1 0 人工智能/应用
Claude Haiku 5.5:降本七成后,操作暴涨编程仍有差
Anthropic刚推的Claude Haiku 5.5,两个核心数字先记牢:OSWorld 2.1评测成绩从上代的15.7%跳至72.4%,平均运行成本直接砍了75%。但有个容易忽略的点:复杂...
2026-10-07 1 0 人工智能/应用
BATok:适配预算的电磁频谱信号分词新方案
现在做电磁频谱监测的,没人再满足于只做特定信号的识别或检测了——要灵活分析不同场景的信号。但卡在一个核心问题:怎么把原始I/Q信号转成大模型能懂的token,同时不超“预算”。原来的信号分词有两...
2026-10-07 1 0 人工智能/应用
谷歌上线一站式Gemini工作代理,打通全场景办公应用
周四谷歌在Gemini at Work活动上,宣布上线一款通用Gemini AI代理。这不是那种只能在单应用里帮你改文档的小工具,是能在后台跨应用、跨设备干活的。一个界面,搞定跨场景任务它会整合...
2026-10-07 1 0 人工智能/应用