文明旁观者的头像

文明旁观者

帅气的我简直无法用语言描述!
TuringViT – 小鹏集团发布的高效视觉编码器

TuringViT – 小鹏集团发布的高效视觉编码器

TuringViT是小鹏集团发布的高效视觉编码器,作为面向VLM/VLA(视觉-语言-动作)时代的物理AI统一感知底座,通过线性注意力架构、精细化数据治理与原生动态分辨率训练,以仅10%的训练数据量实...
文明旁观者的头像6小时前
060
Matrix -Game3.5 – Skywork团队发布的开源多模态世界模型

Matrix -Game3.5 – Skywork团队发布的开源多模态世界模型

Matrix-Game 3.5是昆仑万维旗下Skywork团队发布的开源多模态世界模型,实现Patch级空间记忆机制与单卡实时交互能力,使AI能生成具有物理因果一致性的可交互虚拟世界。它标志着世界模型...
文明旁观者的头像6小时前
060
Hyra-1.0 – 腾讯混元团队推出的科学发现智能体

Hyra-1.0 – 腾讯混元团队推出的科学发现智能体

Hyra-1.0(Hunyuan Research Agent)是腾讯混元团队推出的科学发现智能体,实现递归自我改进能力,能够通过自博弈、自评价和用户反馈驱动的闭环机制,在科研与工程任务中持续自主优化...
文明旁观者的头像13小时前
090
千问办公是什么

千问办公是什么

千问办公是阿里巴巴推出的统一办公智能体(Agent)产品,通过整合内部分散的三款AI办公工具(QoderWork、悟空、MuleRun),解决企业级场景中多产品并行导致的认知混乱与资源分散问题。将AI...
文明旁观者的头像14小时前
0110
MiniCPM-RobotTrack – 视觉-语言-动作(VLA)跟踪导航模型

MiniCPM-RobotTrack – 视觉-语言-动作(VLA)跟踪导航模型

MiniCPM-RobotTrack是面壁智能发布的具身智能系列模型中的轻量级端到端视觉-语言-动作(VLA)跟踪导航模型,专为机器人目标跟踪与自主导航设计。实现无网环境下的纯本地化实时跟踪能力,仅需...
文明旁观者的头像14小时前
0110
token中文叫什么

token中文叫什么

token中文叫什么?在人工智能大模型领域,token的官方规范中文试用定名为词元,由全国科学技术名词审定委员会正式发布。该译名里,“词” 对应其起源于自然语言处理场景的属性,“元” 代表 “基本单元...
文明旁观者的头像15小时前
0110
coze和豆包什么区别

coze和豆包什么区别

豆包是面向普通用户的开箱即用型AI对话助手,直接提供聊天、写作、学习等现成功能;而Coze(扣子)是面向开发者与企业用户的AI智能体开发平台,用于创建和部署自定义AI助手或自动化工作流。两者属于互补关...
文明旁观者的头像16小时前
080
MiniCPM-RobotManip – 开源通用视觉-语言-动作(VLA)模型

MiniCPM-RobotManip – 开源通用视觉-语言-动作(VLA)模型

MiniCPM-RobotManip是面壁智能发布的开源通用视觉-语言-动作(VLA)模型,参数规模仅1.5B,但通过视觉Token极致压缩和流式上下文管理技术,实现了机器人领域关键的长时记忆能力突破...
文明旁观者的头像18小时前
070
Qwen-Audio-3.0-TTS – 阿里通义发布的新一代实时语音合成大模型

Qwen-Audio-3.0-TTS – 阿里通义发布的新一代实时语音合成大模型

Qwen-Audio-3.0-TTS是阿里巴巴通义实验室发布的新一代实时语音合成大模型,包含面向实时交互的Flash版本(首包延迟约300毫秒)和面向高质量生成的Plus版本。该模型在全球第三方权威榜...
文明旁观者的头像18小时前
060
MiniCPM-Robot – 面壁智能发布的开源具身智能系列模型

MiniCPM-Robot – 面壁智能发布的开源具身智能系列模型

MiniCPM-Robot是面壁智能发布的开源具身智能系列模型,包含视觉-语言-动作模型(MiniCPM-RobotManip)和跟踪导航模型(MiniCPM-RobotTrack)两款核心产品。该系...
文明旁观者的头像14小时前
080