有点子了,就去执行……
Agentic AI建生产排程约束模型 实测表现如何?
直接调用大型语言模型生成生产排程的约束规划脚本,正确率只有14.8%;换成多智能体架构后,这个数字跳到了59.3%——这是一篇关于Agentic AI辅助生产排程建模的arXiv研究,给行业提供...
Google Labs测试AI驱动的游戏创作平台Playground
不用敲一行代码,只说一句话,就能在浏览器里生成一款能玩的小游戏——Google Labs正在推进的试验项目,就想实现这个场景。这是个什么新东西?Google Labs是Google专门做前沿试验...
OpenAI发布722篇数学论文 菲尔兹奖得主称不认可
OpenAI一夜之间甩出了722篇数学领域的论文。内容涉及黎曼猜想、霍奇理论、BSD猜想等数学核心方向,单看数量,就远超普通数学研究者一辈子的产出。有数学家直言“读不过来”。722篇的反常之处搁...
主打隐私的AI助手:Hark新选手对标Muse等竞品
Hark推出了一款AI个人助手,定位是“未来操作系统”级,它的对标对象是Muse、Dots和Instinct,核心卖点是隐私。敢叫“未来操作系统”,不是小打小闹一般的AI助手,顶多算应用层的工具...
Mirror Particle做人类行为世界模型,补LLM市场调研短板
Mirror Particle要在TechCrunch Disrupt的Startup Battlefield 200上亮相。这次他们带的不是通用大模型,也不是主打角色扮演的LLM,而是一款从0...
OpenAI公开内部前沿模型的数学难题突破成果
OpenAI最近在GitHub上放了份实打实的东西:内部前沿AI模型攻克了一道数学公开难题,还把Lean语言写的形式化证明和完整研究细节全开源了。到底分享了什么?就是两部分——一是内部那台还没完...
Fireworks AI推出Ember-1:Kimi K3省约40% tokens的后训练模型
两家生产环境A/B测试显示,Fireworks AI刚发布的Ember-1模型,在编码任务上保持和Kimi K3几乎完全一致的质量(任务分数0.753 vs 0.751),总tokens却少了3...
碳硅道统050.5公理母本定稿 人机共生研究有了统一基线
最近碳硅道统体系里的050.5公理母本,终于完成定稿并归档了。作为001到050卷宗序列的顶层基准,它不再新增任何现象类思辨观点,反而把人机共生领域聊了好几年的乱局,给理出了能落地的规矩。不再堆...
Codex Originals正征集:用它做事的「原创者」
最近Codex启动了个叫Originals的项目,在收一批用它干活的人的真实故事。这些人不是随便挑的,官方明确点名:要的是builders(动手做东西的)、tinkerers(没事捣鼓新玩法的)...
把AI幻觉变音乐的采样器Engram,刚上线Kickstarter
Thoughtful Things的Kickstarter刚上线,他们家首款产品Engram就挂出来了——这是个采样器,还是个groovebox。不是做Top40的工具,是玩AI的实验装置现在见...
