获安德森·霍洛维茨投资的Vals,欲成为AI基准测试的黄金标准
Vals AI 希望在一个被AI模型日益淹没的世界里,让AI基准测试成为更中立、更可信的资源。该公司获得了安德森·霍洛维茨(a16z)的投资支持。
Vals AI 希望在一个被AI模型日益淹没的世界里,让AI基准测试成为更中立、更可信的资源。该公司获得了安德森·霍洛维茨(a16z)的投资支持。
SpaceXAI 于 9 月 18 日发布 Grok Voice Transcribe 2.0 语音转文本模型,在价格不变的情况下将词错误率降低约一半,并在 Artificial Analysis 全部 32 款流式模型中准确率排名第一。官方称 Grok Voice 已用于每天数万通客服电话、数百万小时视频旁白转录,以及包括特斯拉车载 Grok 助手在内的硬件语音智能体。新版本定价与 1.0 完全一致:批量转录每小时音频 0.10 美元,实时流式转录每小时 0.20 美元。
中国电信于9月17日发布并开源新一代星辰大模型 Xing4.0-29B-A4B,总参数29B、激活参数仅4B,原生支持256K上下文并可扩展至512K。该模型号称国内首个从训练芯片到推理部署全栈国产(昇腾训练、国产框架适配、自研架构)的百亿参数大模型,在SuperCLUE智能体评测中以93.52分位列第三,与两款头部Qwen模型差距不足1分。4-bit量化后显存占用降至15GB,可在RTX 3090/4090等消费级显卡上本地运行长上下文任务。
9月19日,千问大模型正式发布全新的同声传译大模型Qwen3.8-LiveTranslate。该模型采用Interleave架构重构实时同传,在准确度、流畅度和简洁度上全面提升,字均延迟(LAAL)从2.8秒降至2.3秒。
阿里千问于9月19日发布同声传译大模型 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid MoE 的 Thinker–Talker 双模块设计,将字均延迟从 2.8 秒降至 2.3 秒,并新增实时说话人分离、原文译文同帧同出、长上下文消歧三项能力。官方称该模型支持 60 种语言,在 Omnilingua-MSpeaker 与 FLEURS 评测集上于翻译质量、延迟、语音识别与合成等维度领先上一代及主流实时同传系统。
Anthropic 正在评估是否发布新模型,以对抗 OpenAI 的 GPT-6 Astra——后者在企业与开发者市场均获得显著采用。尽管 Anthropic 目前在收入上仍领先,但其市场份额正承受压力,公司需要在推出新功能与坚持 AI 安全承诺之间取得平衡,同时为预期中的 IPO 做准备。
Anthropic 正在评估推出一款潜在的新模型,以应对 OpenAI 的 GPT-6 Astra 在企业市场获得的增长势头。与此同时,Anthropic 首席执行官达里奥·阿莫代伊却在公开呼吁放缓 AI 能力的开发速度。这一矛盾凸显出前沿模型厂商在竞争压力与安全主张之间的张力。
据报道,Anthropic 正在权衡推出一款新的 AI 模型,以应对 OpenAI 在企业客户市场上不断扩大的优势。与此同时,Anthropic 首席执行官达里奥·阿莫代伊以安全担忧为由,呼吁放慢 AI 开发节奏。该消息主要涉及模型竞争与公司战略,并未披露具体的投资、估值或资本开支数据。
据路透社援引三位知情人士消息,Anthropic 正考虑推出新的人工智能模型,以应对 OpenAI 自发布 GPT-6 Astra 以来所积累的势头。此举发生在该公司筹备 IPO 之际,显示出头部 AI 实验室之间的竞争正与资本市场节奏紧密交织。
据路透社报道,Anthropic 正在权衡是否推出新的 AI 模型,与此同时竞争对手 OpenAI 在市场上逐渐占据上风。该报道未披露具体的发布时间、模型规格或财务数据,仅反映了头部 AI 实验室之间的竞争节奏。
据三位消息人士透露,Anthropic正考虑推出新的人工智能模型,以应对OpenAI自发布GPT-6 Astra以来的强劲势头。此举发生在其预期IPO之前,而此前该公司CEO曾呼吁全行业放缓脚步。
文章回顾了2023年春天以来中国科技界出现的大量新大模型,标志着“百模大战”的开启。文章强调这些模型并非千篇一律,各有特色。
新浪财经报道,全国产算力大模型正式发布,南方基金吴春林聚焦国产科技核心资产。该事件标志着中国在自主算力大模型领域取得进展,可能影响国产AI产业链的投资布局。
IT之家 9 月 7 日消息,一名 AI 爱好者让 OpenAI 的新模型 GPT-6 Astra 自主通关了 3D 解谜游戏《传送门》,共进行 3336 次工具调用,按 API 价格计算成本达 571.18 美元,但实际由每月 200 美元的 Codex Pro 订阅覆盖。实验发起者 CozyBlaze 表示,这次通关不应被视为 AI 能力的标准化基准测试,但展示了通用型智能体的潜力。
讯飞发布了星火X2.5大模型,拥有2930亿参数,完全基于国产算力训练。文章包含对该模型的一手实测,展示了其性能。
宇树科技发布视频称,其UnifoLM-X2-1.0模型突破世界-动作大模型瞬时规划、决策和动态交互执行等瓶颈,实现高动态、强交互、实时预测和规划,从而首次实现人形机器人全自主搏击。这验证了世界模型驱动的人形机器人大规模落地部署的基础可行性。
宇树科技宣布全球首次实现世界模型实时驱动全自主人形机器人格斗,其UnifoLM-X2-1.0模型突破瞬时规划、决策和动态交互执行等瓶颈,实现高动态、强交互的实时预测与规划。该技术验证了世界模型驱动的人形机器人大规模落地部署的基础可行性。
京东 JoyAI App 推出首个能实时视频购物的 AI 数字人,用户可在视频通话中边逛边买,无需切换 App。该数字人支持自定义形象、人设等,并整合了外卖、健康咨询等生活服务。今年以来,JoyAI App 对话用户数增速超过 15 倍。
MiniMax H3 Max等模型的生成速度已超过播放速度,推动AI视频从批量生产转向连续、互动媒体。早期实验展示了聊天驱动的无限直播和近零延迟的叙事游戏,但一致性、成本和安全性仍是待解约束。
文章讨论了AMD等PC厂商如何利用DeepSeek、千问、智谱等中国AI模型,通过端侧部署来降低昂贵的AI Token成本,从而推动AI PC的普及。这标志着AI模型与硬件厂商的合作进入新阶段,旨在让AI应用更经济、更普及。