漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-26 talkingdev

Claude当前分词器或仅1.5万词条,Anthropic如何绕过Softmax瓶颈?

近日,分词器研究者Sander Land复现了类似Claude当前使用的分词器,发现其词表规模仅约15000个条目。这一结果与近年来大模型“词表越大越好”的主流趋势形成明显反差。由于大模型最终输出层的softmax计算成本与词表大...

Read More
2026-08-10 talkingdev

模型基因组:给大模型做个“DNA鉴定”,一眼看穿是否从零训练

在开源大语言模型百花齐放的今天,一个模型究竟是真正从零开始预训练,还是基于现有开源权重衍生微调,常让外界难以分辨。Hugging Face社区发布的“Model Genome”项目,首次提出用类似生物基因指纹的方式为模型“验明...

Read More
2026-04-29 talkingdev

Claude Opus 4.7新分词器上线:输入成本最高上涨27%,短提示词反降价

Anthropic近日通过引入全新分词器(Tokenizer),对其最新旗舰模型Claude Opus 4.7进行了核心升级。此次优化显著提升了模型对输入文本的理解精度,但同时也带来了一个直接影响用户的改变:成本结构调整。虽然模型的...

Read More
2026-02-16 talkingdev

逆向工程GPT-5分词器:20万Token揭示AEO/GEO策略与性能影响

在GPT-5.x等大型语言模型处理文本之前,所有输入都必须经过一个关键的前置组件——分词器分词器本质上是一个压缩层,负责将原始文本转换为一系列整数ID序列。近日,一篇深度技术分析文章通过逆向工程OpenAI开源的分...

Read More
2025-10-14 talkingdev

大语言模型突破字符级文本处理瓶颈,GPT-5与Claude 4.5展现算法理解力跃升

最新研究表明,新一代大语言模型在字符级文本处理任务上取得显著突破。相比早期版本,GPT-5和Claude Sonnet 4.5等模型在字符计数、字符替换、密码解码等需要精细化文本操作的任务中表现出色。这一进步表明模型正在从...

Read More
2025-08-25 talkingdev

短词元更易被选择:大语言模型输出偏差的新发现

最新研究表明,大语言模型存在系统性偏好短词元的倾向,这一发现对自然语言处理领域具有重要影响。由于短词元拥有更多可能的后续组合方式,模型可能会优先选择这些‘松散词元’,即使它们并非最佳语义选择。该研究进一...

Read More
2025-06-10 talkingdev

Chonkie:超轻量级闪电式文本分块,支持多语言与云端部署

Chonkie是一款革命性的开源文本分块库,以其超轻量级架构和闪电般的处理速度重新定义了文本预处理效率。作为GitHub上的明星项目,它具备多语言处理能力、云端就绪特性以及丰富的功能集,支持主流分词器、嵌入模型和A...

Read More
2025-04-15 talkingdev

[开源]GigaTok:3B参数规模的图像分词器突破,重建性能卓越

近期,SilentView团队在GitHub开源了名为GigaTok的超大规模图像分词器项目,其参数量高达30亿(3B),在图像重建任务中展现出卓越性能。传统图像分词器在规模化过程中常面临性能崩溃问题,而GigaTok通过创新的解码器...

Read More
  1. Next Page