AI深识站
  • AI软件
  • AI资讯
  • AI世界漫游指南
    • AI知识探索库
    • AI学习教程
  • AI最新项目
  • 排行榜
      • 未登录
        登录后即可体验更多功能
    • AI软件
    • AI资讯
    • AI世界漫游指南
      • AI知识探索库
      • AI学习教程
    • AI最新项目
    • 排行榜
    未登录
    登录后即可体验更多功能

    大模型

    共 164 篇文章
    排序
    发布更新浏览点赞
    GenCeption – 谷歌DeepMind发布的通用视觉模型

    GenCeption – 谷歌DeepMind发布的通用视觉模型

    GenCeption是谷歌DeepMind发布的通用视觉模型,通过逆向改造视频生成模型,实现单模型统一完成深度估计、图像分割、3D姿态估计等五类核心视觉任务。仅用7500段合成视频训练,即可通过文本指...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01050
    HappyOyster 1.0 – 阿里发布的可实时交互的开放式世界模型

    HappyOyster 1.0 – 阿里发布的可实时交互的开放式世界模型

    HappyOyster 1.0(快乐生蚝1.0)是阿里巴巴ATH创新事业部发布的可实时交互的开放式世界模型产品,将AI从“生成静态内容”升级为“模拟可操控的动态数字世界”。用户仅需一句话或一张图即可生...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01050
    Gemini 3.6 Flash – 谷歌DeepMind发布的效率型大语言模型

    Gemini 3.6 Flash – 谷歌DeepMind发布的效率型大语言模型

    Gemini 3.6 Flash是谷歌DeepMind发布的效率型大语言模型,定位为代码、知识工作与多模态任务的高性价比解决方案。以更低成本实现更强能力:输出Token价格从3.5 Flash的9美元...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01040
    WITT – 文远知行发布的聚焦物理世界认知的AI基础大模型

    WITT – 文远知行发布的聚焦物理世界认知的AI基础大模型

    文远知行发布的 WITT(WeRide World Intelligence Toward Truth) 是全球首个聚焦物理世界认知的AI基础大模型,目标是将真实道路数据转化为可验证、可追溯的物理事实...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01020
    Fun-ASR-Realtime – 通义升级发布的流式实时语音识别大模型

    Fun-ASR-Realtime – 通义升级发布的流式实时语音识别大模型

    Fun-ASR-Realtime是阿里云通义实验室升级发布的流式实时语音识别大模型,首字延迟控制在百毫秒级别、识别准确率接近离线模型,同时支持16种方言与30种语言的无缝识别。该模型专为直播字幕、会议...
    AI最新项目# 大模型
    文明旁观者的头像2个月前
    01020
    SeedRealtime – 字节Seed团队发布的原生音视频全双工大模型

    SeedRealtime – 字节Seed团队发布的原生音视频全双工大模型

    SeedRealtime是字节跳动Seed团队于2026年8月5日正式发布的原生音视频全双工大模型。该模型采用统一端到端架构,将音频、视频与文本原生融合,能够在连续多模态信息流上进行实时交互,官方将其...
    AI最新项目# 大模型
    文明旁观者的头像3周前
    01010
    MiniCPM-RobotTrack – 视觉-语言-动作(VLA)跟踪导航模型

    MiniCPM-RobotTrack – 视觉-语言-动作(VLA)跟踪导航模型

    MiniCPM-RobotTrack是面壁智能发布的具身智能系列模型中的轻量级端到端视觉-语言-动作(VLA)跟踪导航模型,专为机器人目标跟踪与自主导航设计。实现无网环境下的纯本地化实时跟踪能力,仅需...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01010
    OvisOCR2 – 阿里巴巴开源的0.8B参数文档解析模型

    OvisOCR2 – 阿里巴巴开源的0.8B参数文档解析模型

    OvisOCR2是阿里巴巴开源的0.8B参数文档解析模型,首次以端到端架构超越传统流水线方法,在权威基准OmniDocBench v1.6上以96.58分登顶。该模型仅需单次推理即可将文档图像直接转化...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01000
    Wan-Dancer – 阿里通义开源的音乐驱动人像舞蹈视频生成模型

    Wan-Dancer – 阿里通义开源的音乐驱动人像舞蹈视频生成模型

    Wan-Dancer是阿里巴巴通义实验室开源的音乐驱动人像舞蹈视频生成模型,能够生成分钟级、高清晰度且节奏同步的舞蹈视频。它采用分层框架,将生成过程解耦为全局关键帧规划与局部时序优化两个阶段,有效解决...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0990
    MAGI-2 Preview – Sand.ai发布并开源的统一音视频生成模型

    MAGI-2 Preview – Sand.ai发布并开源的统一音视频生成模型

    MAGI-2 Preview是北京AI视频生成创企Sand.ai(清华系团队)正式发布并开源的统一音视频生成模型。该模型总参数约114B(千亿级),采用MoE(混合专家)架构,单次前向计算仅激活约6B...
    AI最新项目# 大模型
    文明旁观者的头像3周前
    0980
    JoyAI-Video-Edit – 京东开源自研的实时流式视频编辑模型

    JoyAI-Video-Edit – 京东开源自研的实时流式视频编辑模型

    JoyAI-Video-Edit是京东探索研究院于2026年8月5日正式开源自研的实时流式视频编辑模型。该模型于2026年7月18日在世界人工智能大会(WAIC)上首次亮相,8月5日在 Hugging...
    AI最新项目# 大模型
    文明旁观者的头像3周前
    0970
    MiniMax H3 – MiniMax发布的开源通用全模态生成模型

    MiniMax H3 – MiniMax发布的开源通用全模态生成模型

    MiniMax H3是MiniMax发布的首款开源通用全模态生成模型,将视频生成从单一任务工具升级为商业级生产力工具。它不再区分图片、视频、音频的独立生成任务,而是通过统一理解多模态上下文直接输出连贯...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0950
    RedKnot – 小红书研发并开源的长上下文大模型推理引擎

    RedKnot – 小红书研发并开源的长上下文大模型推理引擎

    RedKnot是小红书技术团队研发并开源的长上下文大模型推理引擎,通过按注意力头维度优化KV缓存管理,在显著提升推理速度的同时保持高精度,尤其适用于超长文本处理场景。将传统按token粒度的缓存机制重...
    AI最新项目# 大模型
    文明旁观者的头像2个月前
    0950
    North Mini Code – Cohere公司推出的开源智能体编程大模型

    North Mini Code – Cohere公司推出的开源智能体编程大模型

    North Mini Code是Cohere公司推出的开源智能体编程大模型,核心定位为高吞吐、低延迟的代码智能体底座,采用30B总参数量但仅激活3B参数的稀疏混合专家(MoE)架构,专为本地化部署与企...
    AI最新项目# 大模型
    文明旁观者的头像2个月前
    0950
    MiniCPM-Robot – 面壁智能发布的开源具身智能系列模型

    MiniCPM-Robot – 面壁智能发布的开源具身智能系列模型

    MiniCPM-Robot是面壁智能发布的开源具身智能系列模型,包含视觉-语言-动作模型(MiniCPM-RobotManip)和跟踪导航模型(MiniCPM-RobotTrack)两款核心产品。该系...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0930
    Qwen-Audio-3.0-Realtime – 阿里巴巴发布的实时语音交互对话模型

    Qwen-Audio-3.0-Realtime – 阿里巴巴发布的实时语音交互对话模型

    Qwen-Audio-3.0-Realtime是阿里巴巴于2026年7月15日发布的实时语音交互对话模型,通过同步提升推理能力、工具调用、情感表达与双工交互四项核心能力,在毫秒级响应速度下仍保持高精度...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0920
    混元1bit – 腾讯混元Hy3旗舰大模型的1比特极致量化版本

    混元1bit – 腾讯混元Hy3旗舰大模型的1比特极致量化版本

    1bit是腾讯混元Hy3旗舰大模型的1比特极致量化版本(IQ1_M格式),通过梯度量化技术将2950亿参数模型的权重体积从598GB压缩至85.5GiB(缩小6.7倍),实现单张96GB显存显卡即可本...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0910
    AMALIA – 葡萄牙主导开发的葡萄牙语开源大语言模型

    AMALIA – 葡萄牙主导开发的葡萄牙语开源大语言模型

    AMALIA是葡萄牙国家主导开发的首个专为欧洲葡萄牙语(pt-PT)优化的开源大语言模型目标是解决主流AI模型对欧洲葡萄牙语文化及语言细节支持不足的问题,通过深度本地化训练实现对葡萄牙语境、法律体系和...
    AI最新项目# 大模型
    文明旁观者的头像2个月前
    0900
    Gemini 3.5 Flash Cyber – 专为网络安全场景微调的轻量级AI模型

    Gemini 3.5 Flash Cyber – 专为网络安全场景微调的轻量级AI模型

    Gemini 3.5 Flash Cyber是谷歌发布的专为网络安全场景微调的轻量级AI模型,以更低成本高效发现并修复软件安全漏洞。该模型并非独立开放服务,而是深度集成于谷歌的代码安全智能体平台Cod...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0870
    Robostral Navigate – Mistral AI发布的具身导航大模型

    Robostral Navigate – Mistral AI发布的具身导航大模型

    Robostral Navigate是法国AI公司Mistral AI发布的具身导航大模型,参数量仅80亿(8B)。仅依赖单个普通RGB摄像头,即可在复杂环境中实现高精度自主导航,无需深度传感器或激光...
    AI最新项目# 大模型
    文明旁观者的头像2个月前
    0850
    Gemini 3.5 Flash-Lite – 谷歌发布的专为高频任务设计的轻量级AI模型

    Gemini 3.5 Flash-Lite – 谷歌发布的专为高频任务设计的轻量级AI模型

    Gemini 3.5 Flash-Lite是谷歌发布的专为高频任务设计的轻量级AI模型,以极低成本实现超高吞吐量执行,尤其适合智能体(Agent)工作流中的子任务处理。其最大特点是输出速度达350 t...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0840
    SenseNova-Vision – 商汤科技发布并全面开源的统一视觉大模型

    SenseNova-Vision – 商汤科技发布并全面开源的统一视觉大模型

    SenseNova-Vision是商汤科技发布并全面开源的统一视觉大模型,将视觉能力原生融入大模型体系,首次实现目标检测、图像分割、深度预测、3D重建等经典视觉任务的单模型统一处理,彻底摒弃传统多模型...
    AI最新项目# 大模型
    文明旁观者的头像2个月前
    0840
    MiniCPM5-2B – 面壁智能发布的20亿参数规模端侧大语言模型

    MiniCPM5-2B – 面壁智能发布的20亿参数规模端侧大语言模型

    MiniCPM5-2B是面壁智能联合OpenBMB发布的20亿参数规模端侧大语言模型,在Artificial Analysis(AA)权威榜单中以17分成绩登顶全球4B以下模型榜首,成为当前同级参数规...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0830
    Cosmos 3 Edge – 英伟达推出的40亿参数开源世界模型

    Cosmos 3 Edge – 英伟达推出的40亿参数开源世界模型

    Cosmos 3 Edge是英伟达在SIGGRAPH 2026大会上发布的40亿参数开源世界模型,专为边缘设备实时物理AI推理设计。通过双塔架构实现本地化物理世界理解与动作生成,可在Jetson Th...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0810
    Mage-Flow – 微软推出的专注于图像生成与编辑的模型

    Mage-Flow – 微软推出的专注于图像生成与编辑的模型

    Mage-Flow是微软推出的Mage多模态模型家族中专注于图像生成与编辑的模型。它是一款高效的、原生分辨率的基础模型,专为文本生成图像和指令驱动的图像编辑任务而设计。 Mage-Flow核心特点 轻...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0800
    MiniCPM-RobotManip – 开源通用视觉-语言-动作(VLA)模型

    MiniCPM-RobotManip – 开源通用视觉-语言-动作(VLA)模型

    MiniCPM-RobotManip是面壁智能发布的开源通用视觉-语言-动作(VLA)模型,参数规模仅1.5B,但通过视觉Token极致压缩和流式上下文管理技术,实现了机器人领域关键的长时记忆能力突破...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0800
    Qwen3.8-Max – 阿里正式发布的2.4万亿参数旗舰级大语言模型

    Qwen3.8-Max – 阿里正式发布的2.4万亿参数旗舰级大语言模型

    Qwen3.8-Max是阿里巴巴于2026年8月3日正式发布的2.4万亿参数旗舰级大语言模型,能独立完成需数天周期的完整工程和跨应用全流程办公任务,实现从“工具辅助”到“自主交付成果”的能力跃迁。该模...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0780
    神珍 – 上海科学智能研究院发布的科学多模态基础模型

    神珍 – 上海科学智能研究院发布的科学多模态基础模型

    “神珍”(Monkey King Bang, MKB)是上海科学智能研究院发布的科学多模态基础模型,总参数量约110亿,专为统一处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据而设计...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0780
    LingBot-VLA 2.0 – 蚂蚁灵波科技开源的新一代具身智能基座模型

    LingBot-VLA 2.0 – 蚂蚁灵波科技开源的新一代具身智能基座模型

    LingBot-VLA 2.0是蚂蚁灵波科技开源的新一代具身智能基座模型,作为机器人领域的“通用大脑”,通过6万小时高质量真实物理数据训练,首次实现对20多种不同构型机器人的统一控制能力,显著提升了双...
    AI最新项目# 大模型
    文明旁观者的头像2个月前
    0780
    MAI-Image-2.5-Pro – 一款微软自研的图像生成模型

    MAI-Image-2.5-Pro – 一款微软自研的图像生成模型

    MAI-Image-2.5-Pro一款自研AI模型系列中精度最高的图像生成模型,专为企业级高质量图像创作与编辑场景设计。该模型完全基于微软自有清理数据训练,不依赖第三方模型蒸馏,在文字渲染准确性、身份...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0770
    加载更多
    AI深识站
    AI深识站——国内外优质AI工具导航平台,收录AI写作、绘画、办公、音视频等热门工具,配套AI资讯与教程,每日更新,助你高效工作、玩转AI生活!用AI,学AI,从这里开始。Ctrl + D 或 ⌘ + D 添加书签,随时探索AI新世界。

    关于我们广告合作免责声明

    Copyright © 2026 AI深识站 赣ICP备2026009722号-1 
    网址
    网址文章软件
    热门搜索
    元宝豆包DeepSeek千问翻译