OvisOCR2 – 阿里巴巴开源的0.8B参数文档解析模型
OvisOCR2是阿里巴巴开源的0.8B参数文档解析模型,首次以端到端架构超越传统流水线方法,在权威基准OmniDocBench v1.6上以96.58分登顶。该模型仅需单次推理即可将文档图像直接转化...
开源世界模型是什么
开源世界模型是完全公开模型权重、代码及训练方法的物理世界智能系统,让AI具备对真实物理环境的理解、生成与预测能力,而非仅处理文本或静态图像。这类模型通过学习物理规律(如重力、碰撞、材料属性)和时空动态...
Cosmos 3 Edge – 英伟达推出的40亿参数开源世界模型
Cosmos 3 Edge是英伟达在SIGGRAPH 2026大会上发布的40亿参数开源世界模型,专为边缘设备实时物理AI推理设计。通过双塔架构实现本地化物理世界理解与动作生成,可在Jetson Th...
BigMac – 小红书开源的多模态大语言模型训练框架
BigMac是小红书dots infra团队开源的多模态大语言模型训练框架,通过"准依赖安全嵌套流水线"设计,首次实现显存占用与训练速度的同步优化。传统方案中,多模态训练必须在"算力优先"(速度高但显...
Ling 3.0 Flash – 蚂蚁百灵团队最新发布的高效推理大模型
Ling 3.0 Flash是蚂蚁集团百灵团队最新发布的高效推理大模型,总参数量124B,激活参数仅5.1B,在保持高智能水平的同时显著优化Token消耗与推理速度。以1/10的Token消耗实现Ag...
FLUX 3 – Black Forest Labs发布的多模态基础模型
FLUX 3是德国人工智能公司Black Forest Labs发布的全球首个在统一架构下联合训练图像、视频、音频及机器人动作预测的多模态基础模型。通过Self-Flow技术将物理世界的因果逻辑融入生...
MAI-Voice-2-Flash – 微软推出的超低延迟文本转语音模型
MAI-Voice-2-Flash是微软推出的超低延迟文本转语音(TTS)模型,专为高并发实时交互场景设计。以32%的成本降幅实现2倍速度提升(每百万字符15美元),同时保持自然语调与高语音质量,并将...
MAI-Image-2.5-Pro – 一款微软自研的图像生成模型
MAI-Image-2.5-Pro一款自研AI模型系列中精度最高的图像生成模型,专为企业级高质量图像创作与编辑场景设计。该模型完全基于微软自有清理数据训练,不依赖第三方模型蒸馏,在文字渲染准确性、身份...
即梦官网入口网页版
即梦AI是字节跳动推出的一站式AI创意创作平台,致力于成为“人人都能使用的想象力相机”。它集成了强大的文生图、文生视频及智能画布等功能,依托先进的AI模型,能将用户的文字灵感快速转化为高质量的图像与视...
deepseek怎么读正确发音
DeepSeek的标准英文发音为/ˈdiːp siːk/,中文谐音读作“迪普西克”,官方中文译名为“深度求索”,其名称直接体现“深度探索与技术求索”的核心理念,可以跟着小编的脚步一起接下来详细的探究一...









