今日概览
今日科技圈呈现出几条清晰的脉络:AI能力竞赛进入新阶段,Google在机器人领域推出全身体智能层,DeepSeek持续迭代其低价模型矩阵;与此同时,开源基础设施在信任与效率之间寻找平衡——GCC明确拒绝AI生成代码贡献,GitHub推出堆叠PR功能改善大型代码库协作。
安全与隐私议题再次浮出水面,廉价电视盒子被曝内置广告欺诈网络,而一款零权限Android应用则以极简设计回应了用户对数据收集的焦虑。技术文化层面,关于"速度崇拜"的反思与Java语言历时多年的性能演进形成有趣对照。
Gemini Robotics 2发布,机器人获得全身体控制能力;GCC宣布禁止AI生成代码贡献;GitHub推出堆叠PR公开预览;DeepSeek V4 Flash正式开放API;Gander应用实现零权限文件查看;Memo-1复古计算机项目开源;JEP 401值对象预览版合并入OpenJDK主分支。
新闻速递
全智:Gemini Robotics 2 brings whole body intelligence to robots
Google DeepMind发布Gemini Robotics 2,这是下一代机器人的智能层,提供全身体控制、精细操作能力和多机器人协作能力。该版本包含三个核心模型:最先进视觉-语言-动作模型(VLA)Gemini Robotics 2、具身推理模型Gemini Robotics ER 2,以及优化本地运行的Gemini Robotics On-Device 2。
模型已能在Apptronik的Apollo 2人形机器人上演示完整任务:行走、下蹲、伸展并操作物体完成杂乱房间的清洁。ER 2模型现已在Google AI Studio上线,并在Gemini Enterprise Agent Platform进行私有预览。VLA和On-Device模型面向早期合作伙伴开放。
社区讨论集中在实际性能与营销宣传之间的差距。有用户指出演示的成功率约60%、准确率约80%,认为距离生产就绪仍有距离。另有观点认为当前机器人动作缓慢不够流畅,但类比LLM早期发展轨迹,预测几年内可能有大规模应用。
边界:GCC steering committee announces AI policy
GCC指导委员会宣布采纳AI贡献政策,将拒绝任何"具有法律意义的、包含LLM生成内容或源自LLM生成内容的贡献"。政策采用GNU项目维护者指南中对"法律意义"的定义:约15行代码和/或文本即构成版权意义上的显著贡献。但维护者可自行选择接受LLM生成的测试用例。
政策不排除将LLM用于研究、分析、错误发现和报告、补丁审查等用途,只要输出不纳入正式贡献。委员会表示政策将持续演进并定期复审。
社区讨论揭示了更深层的矛盾:大量低质量AI生成的拉取请求正在淹没开源项目,有人描述为"用agent设置提示词,以最低成本提交整个机器生成的PR来提升个人档案"。同时有评论指出GPL依赖版权执行,而AI生成内容不受版权保护,这一冲突终将产生重大影响。
层叠:Stacked PRs are now live on GitHub
GitHub推出堆叠拉取请求功能的公开预览。该功能将大型变更拆分为有序的小规模PR序列,每个PR代表变更的一个聚焦层次。团队可并行审查不同层次,然后一键合并整个堆栈,或逐个落地部分层次。
功能已集成至GitHub CLI扩展(gh-stack)、移动端应用及Copilot。Next.js、TED、WHOOP等项目已在内部使用。TED CTO Andy Merryman指出AI提高了开发效率,但也导致PR体积膨胀,堆叠PR通过逻辑分块改善了审查质量。
preview阶段已暴露若干问题:合并整个堆栈在某些场景下完全失效;若启用squash merge且要求重新审核,堆栈中每个PR都需要重新审批,削弱了核心价值。有开发者质疑与精心编排的commit序列相比,堆叠PR的实际优势何在。
迭代:DeepSeek-V4-Flash Update
DeepSeek官方发布V4-Flash API公共测试版(2026-07-31更新)。该版本仅在架构和规模上与Preview保持一致,经过重新后训练。基准测试成绩包括:Terminal Bench 2.1达82.7、NL2Repo 54.2、Cybergym 76.7、DSBench-FullStack 68.7。官方注明Pro版本API即将发布。
V4系列支持OpenAI ChatCompletions和Anthropic两种接口格式。旧版模型名deepseek-chat和deepseek-reasoner将于2026-07-24停用,过渡期内分别对应V4-Flash的非思考模式和思考模式。
用户反馈显示V4-Flash已在广泛部署:有开发者报告每月花费4.55美元处理超过3亿tokens,用于编码和审查任务。成本优势明显,但也有用户提醒需注意数据隐私条款——该提供商可能使用提示词进行训练并保留提示数据。
隐形:Gander, an Android file viewer that asks for no permissions at all
开源应用Gander提供一个完全离线的Android文件查看器,安装包仅约15MB,支持PDF、Word、Excel、PowerPoint、图片、视频、音频、Markdown和代码格式。其核心特性是不请求任何权限,包括INTERNET权限,因此无法联网。
应用通过Storage Access Framework接收文件,Office格式在锁定WebView内渲染,所有JS库从应用资源加载,文档流来自内容URI。文件夹浏览通过一次性系统授权实现,无需存储权限。支持Android 8.0(API 26)及以上版本。
评论区有人质疑:未声明INTERNET权限是否意味着真正隔离?经确认,Android应用在未获权限时仍可能通过浏览器或其他组件间接访问网络,但Gander的设计确实大幅减少了攻击面。有用户建议增加ODT/ODS格式支持以减少设备上的应用数量。
溯源:Memo-1: A 6502 computer built from scratch, using a Minitel as its terminal
开源项目Memo-1展示了一台基于65C02处理器(运行于1MHz)的简易计算机,配备32KB RAM、16KB ROM、65C22 VIA和6551 ACIA。系统通过Minitel 1b终端交互,并提供两个Atari CX40摇杆接口和卡带扩展槽(KCS标准)。
内存映射清晰划分:$0000-$7FFF为RAM,$8000-$8FFF为VIA和ACIA,$A000-$BFFF为外部插槽,$C000-$FFFF为ROM。外部插槽暴露完整CPU总线,可用于运行外部ROM代码或连接存储扩展。
该项目得到Ben Eater的认可。社区怀念Minitel时代——它同时可作为调制解调器使用,下载速率1200bps,上传仅75bps,曾是连接BBS和NNTP的主要方式。有用户建议补充KiCad等CAD文件以便复现。
根基:JEP 401: Value Objects (Preview) merged to OpenJDK master
JEP 401值对象预览版已合并入OpenJDK主分支,同步引入JEP 539严格字段初始化预览。该功能属于Valhalla项目的第一个部分,旨在解决Java缺乏值类型对特定性能场景的制约。
实现分为三个子审查:JDK语言实现、JVM实现和标准库实现。代码仓库位于valhalla/lworld,每周随jdk/master标签更新并向主PR同步。reviewers包括Coleen Phillimore、Ioi Lam等多位核心开发者。
社区反应积极:有开发者称值类型缺失是"使用Java的最大障碍"。同时有观察者指出Java在多项现代特性上领先JavaScript——如Temporal API、switch表达式,以及现在的值对象,而JavaScript对应的元组与记录提案已被撤回。
编辑手记
今日信息呈现一个有趣的双重趋势:一方面,AI能力边界持续外扩——Google用全身体智能重塑机器人控制范式,DeepSeek以极低价格持续推高代码代理基准,Chrome安全团队用AI发现潜伏13年的沙箱逃逸漏洞;另一方面,开源基础设施开始主动划定边界——GCC拒绝AI生成代码、Java以数年周期谨慎推进值对象、GitHub用堆叠PR改善人工协作流程。
这种张力背后是对"自动化替代"的不同态度。GCC的政策并非反对AI本身,而是拒绝将AI输出直接作为法律意义上的贡献——这暗示开源社区正在建立一道防线:AI可以是工具,但不能成为责任主体。同样,堆叠PR功能虽由AI推动需求(大型PR审查困难),但本质仍是增强人工协作的可控性,而非取代人工判断。
值得注意的信号是,多个项目都在探索"人机协同"的精确分工点:Gemini Robotics的ER模型负责多步任务规划,VLA模型负责运动控制;Gander将文件渲染限制在离线WebView内,切断数据外泄路径;Memo-1用1970年代的硬件架构承载当代开源精神。
接下来值得观察的具体信号包括:GCC的AI政策是否会引发其他关键开源项目的跟进,堆叠PR在真实工作流中的接受度与缺陷修复节奏,以及DeepSeek在Pro版本发布后是否会进一步压缩API市场的价格空间。同时,Java值对象从预览到正式的演进路径,也将反映大型语言项目在性能革新与向后兼容之间的权衡方式。