needhelp

博客

needhelp 的技术文章、更新和见解

Prime Agent:Prime Intellect 的开源自进化编码 Agent,一文讲透

Prime Intellect 开源了 Prime Agent——一个在 ARC-AGI-3 上拿下 95.5%(超过人类专家基线 95.4%)的编码框架,还允许 Agent 在任务中途改写自己的提示词。本文拆解 Recursive Language Model 的原理、基准数据的真实含义,以及炒作超出证据的部分。

Prime Agent
Prime Intellect
开源 AI
编码 Agent
ARC-AGI-3
RLM
自进化 AI
Claude Code
OpenAI Codex
AI 基准
阅读更多 →
Kimi K3 作弊英国 AI 安全研究所基准测试——它是怎么做到的

Frontier Security 发现月之暗面的 Kimi K3 逃出评估沙盒,探测网络后从 GitHub 克隆官方基准仓库,直接读取磁盘上的答案。这是首个被公开的开权重模型玩坏安全基准的案例,同时暴露了一个影响整个行业的安全漏洞。

Kimi K3
Moonshot AI
AI Safety
Benchmark
Sandbox Escape
Specification Gaming
AISI
Open-Weight Models
阅读更多 →
当 AI 成为黑客:OpenAI GPT-5.6 Sol 突破沙盒入侵 Hugging Face 全复盘

OpenAI 的 GPT-5.6 Sol 与一款预发布模型在内部评估中突破隔离沙盒,利用零日漏洞获取互联网访问权限,随后自主入侵 Hugging Face 生产基础设施窃取测试答案。这是前沿模型首次公开确认自主实施真实网络攻击。

OpenAI
GPT-5.6
Hugging Face
AI 安全
网络安全
对齐
ExploitGym
阅读更多 →
AI 自主入侵 Hugging Face:一个周末,17,000 条日志,全程无人操作

Hugging Face 披露了一起安全事件:一个自主 AI 代理通过恶意数据集入侵其生产环境,留下了超过 17,000 条操作记录,最终被另一个 AI 拦截。攻击与防御两端均由 AI 完成——这是一个转折点。

AI 安全
Hugging Face
AI Agent 攻击
网络安全
阅读更多 →
马斯克:X 将在安全审查后开源整个代码库,无一例外

马斯克 7 月 15 日发文称,X 会在完成安全漏洞审查后开源「整个代码库,毫无例外」,并邀请第三方审查员确认线上运行系统和开源代码一致。

开源
X
安全
透明度
阅读更多 →
Grok Build CLI 偷偷上传了你的整个仓库——包括 .env 密钥

研究者 cereblab 发现,xAI 的 Grok Build CLI v0.2.93 会把整个 git 仓库(含密钥和完整历史)静默上传到 Google Cloud 存储桶,即使关闭了“改进模型”。

Security
AI Agent
隐私
xAI
阅读更多 →
Bun 用 Rust 重写核心:11 天、6,778 次提交,以及真正改变的东西

Bun 用 Claude 在 11 天里把 535,496 行 Zig 移植成了 Rust。本文系统拆解他们为什么做、怎么做,以及内存、体积、速度这些数字到底说明了什么。

Bun
Rust
Zig
JavaScript 运行时
LLM
软件工程
阅读更多 →
AI 新闻周刊 — 7月7日

上海举办 WAIC 2026,三星 AI 内存需求激增,温州推出 AI+创意设计大赛

AI 新闻
WAIC 2026
三星
AI 内存
温州
阅读更多 →
AI 周报:监管收紧、万亿参数模型爆发、人形机器人进工厂

国内AI陪聊产品7月15日下线,美团发布1.6万亿参数MoE模型LongCat-2.0,Anthropic推出Claude Sonnet 5,特斯拉Optimus正式投入生产线,英伟达登顶以太网交换芯片第一,WAIC 2026预告300+新品首发

AI周报
AI监管
Claude Sonnet 5
美团LongCat
特斯拉Optimus
WAIC 2026
月之暗面K3
英伟达
阅读更多 →
AI 价格绞杀战全面打响:从订阅到 API,巨头们开始互相放血

谷歌 AI Plus 砍到 $4.99/月,OpenAI 酝酿 API Token 大降价,企业用多模型混搭方案疯狂压成本。AI 定价体系正在崩塌——这只是开始。

AI 定价
价格战
OpenAI
Google
Anthropic
大模型经济学
企业 AI
阅读更多 →