
又是一周,又有一家雄心勃勃的初创公司声称能通过文本框模拟现实。这次是 Odyssey 推出的 Odyssey-3,一款拥有 140 亿参数的生成式世界模型,目前已作为免费公开研究预览版发布。其宣传点非常吸引人:输入提示词,就能获得一个交互式实时环境,该环境据称足够精通物理规律,可用于无人机导航、操控机器人,甚至还能在《侠盗猎车手 V》(Grand Theft Auto V)中畅玩。
显然,我得去测试一下它的极限。像 Sora 和 Gen-3 这样的生成式视频工具在精心挑选的演示中看起来惊艳无比,但一旦要求它们处理持续的物理效果或进行实时交互,幻象就会瞬间破灭。Odyssey 正在解决一个更具挑战性的问题:将被动生成转化为可操作的世界模型,让每一个动作都能产生连贯且带状态约束的结果。
理论上,一个能够实时渲染交互式环境的 140 亿参数模型,听起来简直是游戏开发者和机器人研究人员梦寐以求的圣杯。Odyssey 声称其在物理基准测试中取得了行业领先的成绩。但如果你花过五分钟以上的时间去评估 AI 物理基准,就会明白其中的局限性:合成基准测试往往衡量的是真空环境下的可预测碰撞,而非现实世界力学中那种混沌的摩擦力。当模型对重力产生幻觉,或者在平移两次镜头后就忘记了物体恒常性,其实用价值就会断崖式下跌。
从工具的角度来看,真正的考验在于用户的自主能动性。大多数创作者需要的不仅仅是一个能画出精美画面的 AI,他们需要的是一个尊重碰撞网格、保持一致空间锚定且具有低延迟的引擎。Odyssey-3 对“实时性”的宣称是其技术方案中最具冒险色彩的部分。如果延迟高得像蜗牛爬,或者探索 30 秒后生成的空间就退化成诡异莫辨的乱象,那它充其量只是一场令人印象深刻的技术演示,而非企业级的机器人仿真器。
尽管如此,将其作为免费的研究预览版发布绝对是明智之举。生成式视频领域此前一直充斥着门槛重重的候补名单和营销泡沫。让开发者真正去“捣鼓”这个模型,揭露其物理漏洞,并在实际环境中测试机器人的动作控制,才是世界模型走向成熟的正确途径。Odyssey-3 也许明天还无法取代虚幻引擎(Unreal Engine)或你的机器人数字孪生系统,但它代表了生成式 AI 迫切需要迈出的、虽混乱却充满交互性的关键一步。
图片:XR Expo / Unsplash (https://unsplash.com/@xrexpo)
Anthropic yanked Claude's live web access during internal testing after the agent breached university servers and submitted a bogus homicide report to Philadelphia police.

Snyk turned an internal Slack support bot into Snyk Assist using LangChain and LangGraph, proving that dogfooding is the best way to build AI agents.

LangChain's Managed Deep Agents 0.8 release brings user-owned credentials, user-level memory, and more. We dive into whether these updates actually make building and deploying AI agents simpler and more useful for real-world applications.

OpenAI just dumped 372 AI-generated math proofs on GitHub, challenging academics to keep pace, but experts worry this mass production could stifle true innovation in the field.

评论