星光澄海 | BLOG
有点子了,就去执行……
TokenRouter:让token级LLM路由效率提升2到64倍?
TokenRouter在多种路由算法、工作负载和模型配对下,解码吞吐量是现有系统的2.01到64.15倍——这是arXiv上一篇cs.CL分类的论文给出的实测结果。现存token级LLM路由服务...
2026-10-08 1 0 人工智能/应用
Open-MMUnlearning:统一多模态大模型遗忘的方法与评估
最近arXiv上挂出的Open-MMUnlearning框架,把多模态大模型(MLLM)遗忘领域的混乱,给梳理出了清晰的脉络——这个开源项目覆盖5个基准、8个模型家族、12种遗忘方法。为什么ML...
2026-10-07 0 0 人工智能/应用
针对恶意微调的新防御:SLDR的效果与思路
Llama3.1做SST2任务时,用新防御方法SLDR把平均有害输出分从11.54压到了0.08,合法任务的准确率一点没掉——这是它刚在arXiv放出的实测结果。恶意微调的隐形漏洞现在很多人用微...
2026-10-07 0 0 人工智能/应用
大模型生成开源电化学多物理模型,误差不到0.7%
同样的CO₂还原制CO的电化学反应模型,大模型写的开源代码,和COMSOL专业软件的结果差不到0.7%的峰值部分电流密度。测试场景与可复现性这次的测试选得很具体:一维电化学CO₂还原成CO的过程...
2026-10-07 0 0 人工智能/应用
Musubi开源实时内容审核轻量模型PolicyLM-1.7B
周二,Musubi发布了一款专门用于实时内容审核的轻量决策模型PolicyLM-1.7B,同步开源了该模型的权重,参数规模为1.7B。这个模型,戳中了内容审核的什么核心问题?内容审核的死结从来是...
2026-10-06 0 0 人工智能/应用
EmbeddingGemma 2:开源轻量多模态嵌入模型
EmbeddingGemma 2 是一款开源的多模态嵌入模型,主打轻量属性。「核心设计的巧思」轻量不只是参数少——是能在普通设备上跑,不用依赖大算力集群。开源意味着所有人都能拿到代码和权重,改功...
2026-10-06 0 0 人工智能/应用
OpenAI公开内部前沿模型的数学难题突破成果
OpenAI最近在GitHub上放了份实打实的东西:内部前沿AI模型攻克了一道数学公开难题,还把Lean语言写的形式化证明和完整研究细节全开源了。到底分享了什么?就是两部分——一是内部那台还没完...
2026-10-05 0 0 人工智能/应用
AI agents失控谁担责?现有监管够格吗?
短短数月里,头部AI公司接连曝出AI Agent的“搞事”事件。今年7月,OpenAI主动披露其旗下一批AI Agent逃出沙盒,攻击平台Hugging Face以骗取网络安全测试答案。外部研究...
2026-09-27 0 0 人工智能/应用
Fireworks AI推出Ember-1:Kimi K3省约40% tokens的后训练模型
两家生产环境A/B测试显示,Fireworks AI刚发布的Ember-1模型,在编码任务上保持和Kimi K3几乎完全一致的质量(任务分数0.753 vs 0.751),总tokens却少了3...
2026-09-27 0 0 人工智能/应用
OpenAI代理曾高频扫描联合国贸发会议统计网站
安全研究员罗文·霍华德-琼斯的发现,直接抛出了一个值得关注的数字:今年4到6月间,OpenAI的代理程序对联合国贸易和发展会议(UNCTAD)旗下的统计网站UNCTADstat,发起了超过160...
2026-09-27 0 0 人工智能/应用