Ai
主题归档 • 11 条结果
2026-09-28
科技
研究人员推出ScopeBench基准以评估AI智能体安全边界: 研究人员推出了 ScopeBench,这是一个由 30 个死胡同式智能体安全任务组成的基准,旨在衡量攻防安全中的范围遵从性。在这些任务中,只有违反指定范围才能达成既定目标。
AI安全与对齐 • arXiv
永久链接美团发布1.6万亿参数多模态混合专家模型LongCat-2.5-Preview: 美团发布了 LongCat-2.5-Preview,这是一个拥有 1.6 万亿参数的混合专家模型,激活参数约为 480 亿。该模型具备原生 100 万 token 的多模态上下文窗口,专为长时程软件智能体设计。此次发布未公布基准测试结果。
AI模型 • Pandaily
永久链接华为开源openPangu-2.0预训练与强化学习代码: 华为昇腾部落已开源其 openPangu-2.0 模型系列的预训练、监督微调与强化学习代码。此次发布包括 openPangu-2.0-Training 和 openPangu-2.0-RL。该代码针对华为基于昇腾的训练生态进行了优化。
AI基础设施 • TechNode
永久链接研究显示AI智能体提出55%的模型开发方案,但人类仍掌握85%决策权: 对构建AI模型的769个任务日志的分析显示,AI智能体提供了多达55%的方法提案。然而,人类仍然做出了超过85%的最终决策。研究人员指出,如果没有AI辅助,三分之一的任务将不会被尝试。
人工智能 • The Decoder
永久链接英伟达推出开源智能体安全平台以防止AI逃逸: Nvidia推出了Open Agent Safety Platform,这是一个参考设计,旨在防止AI智能体逃脱限制。该平台由用于CPU的OpenShell和用于网络芯片的Sentry组成,允许开发人员为他们的AI智能体建立安全防护。
英伟达 • Techmeme
永久链接阶跃星辰发布6000亿参数Step 5预览版大模型: StepFun发布了其Step 5 Preview模型,这是一个稀疏混合专家模型,总参数约6000亿,激活参数270亿。该模型具备100万token的上下文窗口,适用于长期运行的智能体,其API现已上线,BF16开放权重计划于2026年10月15日发布。
阶跃星辰 • Pandaily
永久链接研究人员提出技能级联攻击新范式,将恶意目标分散至多个技能: 研究人员提出了技能级联攻击,这是一种针对基于技能的智能体系统的新型威胁范式。这种攻击将恶意目标分布到多个技能中,使得每个单独的修改在孤立看来都是良性的。
Security • arXiv
永久链接研究定义大模型帕金森症候群,揭示智能体持续执行低价值任务行为: 研究人员将“LLM Parkinsonism”定义为一个隐喻,用来描述尽管任务级价值不断降低,仍持续采取行动的自主智能体。这种模式包括产生低价值的修改、重复验证,以及修复自身造成的复杂性。
科研前沿 • arXiv
永久链接