AI深识站
  • AI软件
  • AI资讯
  • AI世界漫游指南
    • AI知识探索库
    • AI学习教程
  • AI最新项目
  • 排行榜
      • 未登录
        登录后即可体验更多功能
    • AI软件
    • AI资讯
    • AI世界漫游指南
      • AI知识探索库
      • AI学习教程
    • AI最新项目
    • 排行榜
    未登录
    登录后即可体验更多功能

    大模型

    共 150 篇文章
    排序
    发布更新浏览点赞
    Wan3.0 – 阿里巴巴通义万相团队研发的新一代视频生成大模型

    新Wan3.0 – 阿里巴巴通义万相团队研发的新一代视频生成大模型

    Wan3.0(万相3.0)是阿里巴巴通义万相团队研发的新一代视频生成大模型,于2026年8月6日正式开启公测。作为Wan系列的第三代核心版本,它在生成时长、多模态输入、画面真实感和跨帧一致性四大维度实...
    AI最新项目# 大模型
    文明旁观者的头像3天前
    0250
    Alpamayo 2 Super – 英伟达开源视觉-语言-动作推理模型

    新Alpamayo 2 Super – 英伟达开源视觉-语言-动作推理模型

    Alpamayo 2 Super 是英伟达(NVIDIA)发布的一款320亿参数开放视觉-语言-动作推理模型(Reasoning VLA)。它由英伟达创始人兼CEO黄仁勋亲自揭幕,是Alpamayo系...
    AI最新项目# 大模型
    文明旁观者的头像4天前
    0210
    LFM2.5-2.6B – Liquid AI发布的一款开源端侧智能体模型

    新LFM2.5-2.6B – Liquid AI发布的一款开源端侧智能体模型

    LFM2.5-2.6B是由人工智能初创企业Liquid AI于2026年8月5日正式发布的一款开源端侧智能体模型。该模型隶属于 Liquid AI 的 Liquid Foundation Models...
    AI最新项目# 大模型
    文明旁观者的头像4天前
    0270
    SeedRealtime – 字节Seed团队发布的原生音视频全双工大模型

    新SeedRealtime – 字节Seed团队发布的原生音视频全双工大模型

    SeedRealtime是字节跳动Seed团队于2026年8月5日正式发布的原生音视频全双工大模型。该模型采用统一端到端架构,将音频、视频与文本原生融合,能够在连续多模态信息流上进行实时交互,官方将其...
    AI最新项目# 大模型
    文明旁观者的头像5天前
    0220
    JoyAI-Video-Edit – 京东开源自研的实时流式视频编辑模型

    新JoyAI-Video-Edit – 京东开源自研的实时流式视频编辑模型

    JoyAI-Video-Edit是京东探索研究院于2026年8月5日正式开源自研的实时流式视频编辑模型。该模型于2026年7月18日在世界人工智能大会(WAIC)上首次亮相,8月5日在 Hugging...
    AI最新项目# 大模型
    文明旁观者的头像5天前
    0260
    MAGI-2 Preview – Sand.ai发布并开源的统一音视频生成模型

    新MAGI-2 Preview – Sand.ai发布并开源的统一音视频生成模型

    MAGI-2 Preview是北京AI视频生成创企Sand.ai(清华系团队)正式发布并开源的统一音视频生成模型。该模型总参数约114B(千亿级),采用MoE(混合专家)架构,单次前向计算仅激活约6B...
    AI最新项目# 大模型
    文明旁观者的头像5天前
    0250
    Shieldstral – Mistral AI发布的开源多模态内容安全审核模型

    新Shieldstral – Mistral AI发布的开源多模态内容安全审核模型

    Shieldstral是Mistral AI发布的开源多模态内容安全审核模型(Shieldstral 1.0-3B)。这是一款仅30亿参数的多模态内容安全分类器,已在 Hugging Face 以Ap...
    AI最新项目# 大模型
    文明旁观者的头像5天前
    0230
    Hy ASR 3.0 Preview – 腾讯混元发布的新一代语音识别模型

    新Hy ASR 3.0 Preview – 腾讯混元发布的新一代语音识别模型

    Hy ASR 3.0 Preview是腾讯混元发布的新一代语音识别(ASR)模型。它基于腾讯最新一代大语言模型 Hy3的语言理解能力,将高精度语音识别与深度语义理解深度融合,标志着语音识别从传统的"逐...
    AI最新项目# 大模型
    文明旁观者的头像5天前
    0240
    MAI Realtime – 微软正在测试的首款原生实时语音交互模型

    新MAI Realtime – 微软正在测试的首款原生实时语音交互模型

    MAI Realtime是微软(Microsoft AI)正在测试的首款原生实时语音交互模型,于2026年8月初被媒体曝光。它属于微软自研MAI(Microsoft AI)系列模型家族中的语音交互产品...
    AI最新项目# 大模型
    文明旁观者的头像6天前
    0320
    SenseNova U1.5-Lite-Preview – 轻量级统一多模态模型预览版本

    新SenseNova U1.5-Lite-Preview – 轻量级统一多模态模型预览版本

    SenseNova U1.5-Lite-Preview是商汤科技正式面向社区开源发布的轻量级统一多模态模型预览版本。它并非简单的模型规模升级,而是基于今年4月发布的SenseNova U1进行的一次系...
    AI最新项目# 大模型
    文明旁观者的头像6天前
    0280
    Qwen3.8-Max – 阿里正式发布的2.4万亿参数旗舰级大语言模型

    新Qwen3.8-Max – 阿里正式发布的2.4万亿参数旗舰级大语言模型

    Qwen3.8-Max是阿里巴巴于2026年8月3日正式发布的2.4万亿参数旗舰级大语言模型,能独立完成需数天周期的完整工程和跨应用全流程办公任务,实现从“工具辅助”到“自主交付成果”的能力跃迁。该模...
    AI最新项目# 大模型
    文明旁观者的头像7天前
    0380
    DeepSeek-V4-Flash正式版 – DeepSeek推出的API公测模型

    DeepSeek-V4-Flash正式版 – DeepSeek推出的API公测模型

    DeepSeek-V4-Flash正式版是DeepSeek推出的API公测模型,作为V4系列的经济高效版本,在保持原有架构(2840亿总参数/130亿激活参数)不变的前提下,仅通过后训练优化,显著提升...
    AI最新项目# 大模型
    文明旁观者的头像1周前
    0270
    FeyNoBg – Feyn团队发布的开源背景移除模型

    FeyNoBg – Feyn团队发布的开源背景移除模型

    FeyNoBg是Feyn团队发布的开源背景移除(抠图)模型,基于BiRefNet架构深度优化,参数量263M,在八大主流基准测试中四项登顶SOTA(State-of-the-Art),并配套开源NoB...
    AI最新项目# 大模型
    文明旁观者的头像1周前
    0370
    K-EXAONE 2.0 – LG AI研究院发布的开源大型人工智能基础模型

    K-EXAONE 2.0 – LG AI研究院发布的开源大型人工智能基础模型

    K-EXAONE 2.0是LG AI研究院发布的开源大型人工智能基础模型,采用混合注意力专家混合(MoE)架构,总参数规模达7500亿,实际激活参数为370亿,是当前韩国开发规模最大的AI基础模型。该...
    AI最新项目# 大模型
    文明旁观者的头像1周前
    0340
    Inkling-Small – Thinking Machines Lab发布的轻量级开源大模型

    Inkling-Small – Thinking Machines Lab发布的轻量级开源大模型

    Inkling-Small是Thinking Machines Lab发布的轻量级开源大模型,采用混合专家(MoE)架构,总参数276B、激活参数仅12B(约为原版Inkling的四分之一),却在多项...
    AI最新项目# 大模型
    文明旁观者的头像1周前
    0340
    Qwen-Audio-3.0-ASR-Filetrans – 阿里巴巴推出的非实时语音识别模型

    Qwen-Audio-3.0-ASR-Filetrans – 阿里巴巴推出的非实时语音识别模型

    Qwen-Audio-3.0-ASR-Filetrans是阿里巴巴推出的非实时语音识别模型,专为长音频文件离线转写设计,高精度处理12小时以内大体积音频(单文件≤2GB),支持字级时间戳与上下文增强...
    AI最新项目# 大模型
    文明旁观者的头像1周前
    0350
    Qwen-Audio-3.0-ASR-Flash – 阿里巴巴发布的专业级语音识别大模型

    Qwen-Audio-3.0-ASR-Flash – 阿里巴巴发布的专业级语音识别大模型

    Qwen-Audio-3.0-ASR-Flash是阿里巴巴发布的专业级语音识别大模型,显著提升行业术语识别准确率(医疗场景达95.36%),并具备上下文一致性优化与语音润色能力,可直接输出结构化文本...
    AI最新项目# 大模型
    文明旁观者的头像1周前
    0300
    MiniMax H3 – MiniMax发布的开源通用全模态生成模型

    MiniMax H3 – MiniMax发布的开源通用全模态生成模型

    MiniMax H3是MiniMax发布的首款开源通用全模态生成模型,将视频生成从单一任务工具升级为商业级生产力工具。它不再区分图片、视频、音频的独立生成任务,而是通过统一理解多模态上下文直接输出连贯...
    AI最新项目# 大模型
    文明旁观者的头像1周前
    0330
    Grok Voice Think Fast 2.0 – xAI公司发布的新一代语音智能体模型

    Grok Voice Think Fast 2.0 – xAI公司发布的新一代语音智能体模型

    Grok Voice Think Fast 2.0是马斯克旗下xAI公司发布的新一代语音智能体模型,定位为端到端语音到语音(speech-to-speech)AI系统,无需依赖传统"语音识别-大模型推...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0320
    Lyria 3.5 – 谷歌DeepMind发布的最新AI音乐生成模型

    Lyria 3.5 – 谷歌DeepMind发布的最新AI音乐生成模型

    Lyria 3.5是谷歌DeepMind发布的最新AI音乐生成模型,作为Lyria系列的迭代版本,将AI从"一次性生成工具"升级为"可交互的创作伙伴"。支持对已生成歌曲的局部段落进行自然语言修改(如仅...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0320
    Instella-MoE – AMD推出的全开源混合专家语言模型(MoE)

    Instella-MoE – AMD推出的全开源混合专家语言模型(MoE)

    Instella-MoE是AMD推出的全开源混合专家语言模型(MoE),总参数量达160亿,但推理时仅激活28亿参数,通过专家稀疏激活机制实现高性能与低计算成本的平衡。完全基于AMD自研硬件与软件栈训...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0380
    Midjourney V8.2 – Midjourney发布的图像生成模型重大更新版本

    Midjourney V8.2 – Midjourney发布的图像生成模型重大更新版本

    Midjourney V8.2是Midjourney正式发布的图像生成模型重大更新版本,通过重构美学奖励模型与个性化系统,显著降低随机生成劣质图像的概率,并大幅提升对用户审美偏好的精准捕捉能力。相比此...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0390
    Anthropic Opus 5 – Anthropic公司发布的旗舰级AI模型

    Anthropic Opus 5 – Anthropic公司发布的旗舰级AI模型

    Anthropic Opus 5是Anthropic公司发布的高性价比旗舰级AI模型,定位为性能逼近顶级模型Fable 5但价格仅为其一半的日常任务首选方案。通过动态调节"思考档位"(effort)机...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0440
    OvisOCR2 – 阿里巴巴开源的0.8B参数文档解析模型

    OvisOCR2 – 阿里巴巴开源的0.8B参数文档解析模型

    OvisOCR2是阿里巴巴开源的0.8B参数文档解析模型,首次以端到端架构超越传统流水线方法,在权威基准OmniDocBench v1.6上以96.58分登顶。该模型仅需单次推理即可将文档图像直接转化...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0760
    Cosmos 3 Edge – 英伟达推出的40亿参数开源世界模型

    Cosmos 3 Edge – 英伟达推出的40亿参数开源世界模型

    Cosmos 3 Edge是英伟达在SIGGRAPH 2026大会上发布的40亿参数开源世界模型,专为边缘设备实时物理AI推理设计。通过双塔架构实现本地化物理世界理解与动作生成,可在Jetson Th...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0570
    BigMac – 小红书开源的多模态大语言模型训练框架

    BigMac – 小红书开源的多模态大语言模型训练框架

    BigMac是小红书dots infra团队开源的多模态大语言模型训练框架,通过"准依赖安全嵌套流水线"设计,首次实现显存占用与训练速度的同步优化。传统方案中,多模态训练必须在"算力优先"(速度高但显...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0500
    Ling 3.0 Flash – 蚂蚁百灵团队最新发布的高效推理大模型

    Ling 3.0 Flash – 蚂蚁百灵团队最新发布的高效推理大模型

    Ling 3.0 Flash是蚂蚁集团百灵团队最新发布的高效推理大模型,总参数量124B,激活参数仅5.1B,在保持高智能水平的同时显著优化Token消耗与推理速度。以1/10的Token消耗实现Ag...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0980
    FLUX 3 – Black Forest Labs发布的多模态基础模型

    FLUX 3 – Black Forest Labs发布的多模态基础模型

    FLUX 3是德国人工智能公司Black Forest Labs发布的全球首个在统一架构下联合训练图像、视频、音频及机器人动作预测的多模态基础模型。通过Self-Flow技术将物理世界的因果逻辑融入生...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0720
    MAI-Voice-2-Flash – 微软推出的超低延迟文本转语音模型

    MAI-Voice-2-Flash – 微软推出的超低延迟文本转语音模型

    MAI-Voice-2-Flash是微软推出的超低延迟文本转语音(TTS)模型,专为高并发实时交互场景设计。以32%的成本降幅实现2倍速度提升(每百万字符15美元),同时保持自然语调与高语音质量,并将...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0500
    MAI-Image-2.5-Pro – 一款微软自研的图像生成模型

    MAI-Image-2.5-Pro – 一款微软自研的图像生成模型

    MAI-Image-2.5-Pro一款自研AI模型系列中精度最高的图像生成模型,专为企业级高质量图像创作与编辑场景设计。该模型完全基于微软自有清理数据训练,不依赖第三方模型蒸馏,在文字渲染准确性、身份...
    AI最新项目# 大模型
    文明旁观者的头像2周前
    0600
    加载更多
    AI深识站
    AI深识站——国内外优质AI工具导航平台,收录AI写作、绘画、办公、音视频等热门工具,配套AI资讯与教程,每日更新,助你高效工作、玩转AI生活!用AI,学AI,从这里开始。Ctrl + D 或 ⌘ + D 添加书签,随时探索AI新世界。

    关于我们广告合作免责声明

    Copyright © 2026 AI深识站 赣ICP备2026009722号-1 
    网址
    网址文章软件
    热门搜索
    元宝豆包DeepSeek千问翻译