PerceptionBench – 月之暗面开源的多模态大模型视觉感知评测基准PerceptionBench是由月之暗面(Kimi)团队开源的多模态大模型视觉感知能力评测基准,剥离推理与背景知识干扰,专注评估模型最基础的“纯粹视觉感知”能力。将视觉任务拆解为10项原子级能力,通...AI最新项目2周前0360
MCP 2026-07-28 – Anthropic发布的模型上下文协议更新版本MCP 2026-07-28是Anthropic发布的模型上下文协议(Model Context Protocol)重大更新版本,从有状态协议全面转向无状态架构,彻底移除会话机制,使AI智能体与外部工...AI最新项目1周前0340
FeyNoBg – Feyn团队发布的开源背景移除模型FeyNoBg是Feyn团队发布的开源背景移除(抠图)模型,基于BiRefNet架构深度优化,参数量263M,在八大主流基准测试中四项登顶SOTA(State-of-the-Art),并配套开源NoB...AI最新项目# 大模型1周前0330
K-EXAONE 2.0 – LG AI研究院发布的开源大型人工智能基础模型K-EXAONE 2.0是LG AI研究院发布的开源大型人工智能基础模型,采用混合注意力专家混合(MoE)架构,总参数规模达7500亿,实际激活参数为370亿,是当前韩国开发规模最大的AI基础模型。该...AI最新项目# 大模型1周前0330
Qwen-Audio-3.0-ASR-Filetrans – 阿里巴巴推出的非实时语音识别模型Qwen-Audio-3.0-ASR-Filetrans是阿里巴巴推出的非实时语音识别模型,专为长音频文件离线转写设计,高精度处理12小时以内大体积音频(单文件≤2GB),支持字级时间戳与上下文增强...AI最新项目# 大模型1周前0330
Qwen-Audio-3.0-ASR-Flash-Streaming – 实时流式语音识别服务Qwen-Audio-3.0-ASR-Flash-Streaming是阿里云百炼平台推出的实时流式语音识别服务,基于单模型架构实现300毫秒级超低延迟响应,原生支持中、日、韩、东南亚语言、阿拉伯语及欧...AI最新项目1周前0320
MiniMax H3 – MiniMax发布的开源通用全模态生成模型MiniMax H3是MiniMax发布的首款开源通用全模态生成模型,将视频生成从单一任务工具升级为商业级生产力工具。它不再区分图片、视频、音频的独立生成任务,而是通过统一理解多模态上下文直接输出连贯...AI最新项目# 大模型1周前0320
新Qwen3.8-Max – 阿里正式发布的2.4万亿参数旗舰级大语言模型Qwen3.8-Max是阿里巴巴于2026年8月3日正式发布的2.4万亿参数旗舰级大语言模型,能独立完成需数天周期的完整工程和跨应用全流程办公任务,实现从“工具辅助”到“自主交付成果”的能力跃迁。该模...AI最新项目# 大模型5天前0310
coze和workbuddy的区别coze和workbuddy的区别是什么?很多小伙伴都想了解这两款AI工具,今天我们来详细的说一说,Coze是“造工具的平台”,需用户主动设计AI工作流;WorkBuddy是“直接替你干活的秘书”,用...AI最新项目1周前0310
Inkling-Small – Thinking Machines Lab发布的轻量级开源大模型Inkling-Small是Thinking Machines Lab发布的轻量级开源大模型,采用混合专家(MoE)架构,总参数276B、激活参数仅12B(约为原版Inkling的四分之一),却在多项...AI最新项目# 大模型1周前0310
Lyria 3.5 – 谷歌DeepMind发布的最新AI音乐生成模型Lyria 3.5是谷歌DeepMind发布的最新AI音乐生成模型,作为Lyria系列的迭代版本,将AI从"一次性生成工具"升级为"可交互的创作伙伴"。支持对已生成歌曲的局部段落进行自然语言修改(如仅...AI最新项目# 大模型1周前0310
AlphaEval – SII-GAIR等机构联合推出的生产级AI智能体评测框架AlphaEval是由SII-GAIR、上海交通大学、跨赴科技(KuaFuAI)等机构联合推出的生产级AI智能体评测框架,解决现有评测体系与真实商业环境脱节的问题。将评估焦点从“答案正确性”转向“端到...AI最新项目2周前0310
新HOST框架 – 自变量机器人开源发布的技能获取技术HOST框架是由中国具身智能企业自变量机器人于2026年8月3日开源发布的技能获取技术,全称为Human-to-robot One-Shot Skill Acquisition(人类到机器人单样本技能...AI最新项目6天前0300
新MAI Realtime – 微软正在测试的首款原生实时语音交互模型MAI Realtime是微软(Microsoft AI)正在测试的首款原生实时语音交互模型,于2026年8月初被媒体曝光。它属于微软自研MAI(Microsoft AI)系列模型家族中的语音交互产品...AI最新项目# 大模型5天前0290
Qwen-Audio-3.0-ASR-Flash – 阿里巴巴发布的专业级语音识别大模型Qwen-Audio-3.0-ASR-Flash是阿里巴巴发布的专业级语音识别大模型,显著提升行业术语识别准确率(医疗场景达95.36%),并具备上下文一致性优化与语音润色能力,可直接输出结构化文本...AI最新项目# 大模型1周前0290
Grok Voice Think Fast 2.0 – xAI公司发布的新一代语音智能体模型Grok Voice Think Fast 2.0是马斯克旗下xAI公司发布的新一代语音智能体模型,定位为端到端语音到语音(speech-to-speech)AI系统,无需依赖传统"语音识别-大模型推...AI最新项目# 大模型1周前0290
QoderVoice – 阿里Qoder推出的国内首个实时语音交互智能体QoderVoice是阿里Qoder推出的国内首个实时语音交互智能体,专为编程场景设计,通过全双工语音技术实现开发者与AI的实时双向讨论式协作,用户可直接用语音下达指令、调整需求,AI同步执行任务并动...AI最新项目2周前0290
新SenseNova U1.5-Lite-Preview – 轻量级统一多模态模型预览版本SenseNova U1.5-Lite-Preview是商汤科技正式面向社区开源发布的轻量级统一多模态模型预览版本。它并非简单的模型规模升级,而是基于今年4月发布的SenseNova U1进行的一次系...AI最新项目# 大模型5天前0270
新万有无界 – 阿里万有无界企业级人与AI智能体协作平台万有无界是阿里云正在内测的企业级人与AI智能体(Agent)协作平台,核心通过自动组建多角色数字员工团队,围绕复杂项目实现端到端协同交付,而非提供零散建议。将传统单智能体交互升级为多智能体分工协作模式...AI最新项目6天前0260
新普罗米修斯 – Majestic Labs发布的AI服务器产品普罗米修斯是初创公司Majestic Labs于2026年8月2日发布的AI服务器产品,突破超大规模AI模型推理中的“内存墙”瓶颈。其最大特点是单机支持8TB–128TB LPDDR6内存,远超英伟达...AI最新项目7天前0250
新DeepSeek-V4-Flash正式版 – DeepSeek推出的API公测模型DeepSeek-V4-Flash正式版是DeepSeek推出的API公测模型,作为V4系列的经济高效版本,在保持原有架构(2840亿总参数/130亿激活参数)不变的前提下,仅通过后训练优化,显著提升...AI最新项目# 大模型7天前0250
新E-Bench – 腾讯混元团队等推出的智能体评测基准E-Bench是腾讯混元团队联合清华、东南高校推出的全合成式多步骤工具智能体评测基准,专门针对大模型智能体多轮、带状态变更、长链路工具调用能力做标准化测评,区别于仅测试单次 API 调用的传统基准。整...AI最新项目5天前0240
新GenOffice – Genspark发布的AI原生本地办公客户端GenOffice是由Genspark发布的 AI 原生(AI-Native)本地办公客户端,完全免费、开源且无广告,解决 AI 生成内容与办公文档“可交付成品”之间的格式断层问题。它通过 AI 生成...AI最新项目5天前0240
新PicsetAI – 电商领域的专业AI视觉生成工具PicsetAI是面向电商领域的专业AI视觉生成工具,主打商品图片批量制作与风格复刻。仅需上传产品实拍图,AI 自动识别产品特征,批量生成主图、场景图与整套详情素材。支持复刻爆款版式配色,重塑专业棚拍...AI最新项目6天前0230
新MindMemOS – 华为诺亚方舟实验室开源的面向智能体记忆操作层MindMemOS是华为诺亚方舟实验室开源的、面向 AI Agent(智能体)的可迁移、自演进记忆操作层(Memory Operating Layer)。它借鉴了传统操作系统管理内存资源的思路,把"记...AI最新项目5天前0220
新JoyAI-Video-Edit – 京东开源自研的实时流式视频编辑模型JoyAI-Video-Edit是京东探索研究院于2026年8月5日正式开源自研的实时流式视频编辑模型。该模型于2026年7月18日在世界人工智能大会(WAIC)上首次亮相,8月5日在 Hugging...AI最新项目# 大模型3天前0210
新SeedRealtime – 字节Seed团队发布的原生音视频全双工大模型SeedRealtime是字节跳动Seed团队于2026年8月5日正式发布的原生音视频全双工大模型。该模型采用统一端到端架构,将音频、视频与文本原生融合,能够在连续多模态信息流上进行实时交互,官方将其...AI最新项目# 大模型3天前0200
新MAGI-2 Preview – Sand.ai发布并开源的统一音视频生成模型MAGI-2 Preview是北京AI视频生成创企Sand.ai(清华系团队)正式发布并开源的统一音视频生成模型。该模型总参数约114B(千亿级),采用MoE(混合专家)架构,单次前向计算仅激活约6B...AI最新项目# 大模型3天前0200
新Qwen-CUA – 阿里巴巴通义实验室推出的原生计算机使用智能体框架Qwen-CUA是阿里巴巴通义实验室推出的原生计算机使用智能体(Computer-Use Agent, CUA)框架,其核心能力是让大模型直接通过视觉感知屏幕界面,像人类一样操作鼠标键盘完成跨应用任务...AI最新项目3天前0200
新MemHarness – 上海AI Lab团队及其合作者推出的智能体记忆重构框架MemHarness 是由上海人工智能实验室(Shanghai AI Lab)团队及其合作者提出的一种“LLM Agent 经验重构”框架。其核心目标是让 AI 智能体(Agent)的记忆机制像人类一...AI最新项目4天前0190