IT技术博客大学习 共学习 共进步
全部 移动开发 后端 数据库 AI 算法 安全 DevOps 前端 设计 开发者

标签:基准测试

共 5 篇相关文章

IT 累计浏览 94

美团 LongCat 开源 General 365:树立推理评测新标尺

美团LongCat团队开源General 365,这是一个针对大语言模型通用推理能力的创新基准。当前大模型在学科推理任务如数学和编程中表现优异,但面对日常逻辑问题时却常缺乏常识,暴露了评测体系的缺陷:过度依赖专业知识记忆,而非真实逻辑推演能力。现有基准如BBH面临模板化和性能饱和问题。General 365通过365道人工原创题目及1095个扩展变体,系统覆盖复杂约束、分支枚举、时空推理等八大挑战类型,知识范围严格限定在K-12水平,以解耦推理与知识检索,纯粹评估模型的逻辑能力。基准设计强调高多样性、高挑战性,并经过严格人工质检和混合评分确保可靠性。实测26款主流模型显示,Gemini 3 Pro以62.8%准确率领先,但仅2款模型及格,揭示了模型在语义干扰和最优策略维度上的普遍短板。跨基准对比表明,模型在该基准上准确率显著下降,输出长度增加,证实其难度源于深层逻辑链条。该项目旨在树立推理评测新标尺,推动大模型向具备通用推理能力的智能体演进,填补了现有评测空白。

IT 累计浏览 98

LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征

具身智能领域面临带动作标注数据稀缺的挑战,机器人泛化能力受限。LARYBench 作为首个系统化评测基准,针对隐式动作表征进行量化评估,旨在从大规模人类视频中学习通用动作语义。该基准通过多粒度动作定义,包括本体动作、原子语义动作和复合语义动作,覆盖超过100万段视频、151种动作类型和11种机器人形态,构建了多样化数据集。评测采用浅层探测头验证表征质量,涵盖动作回归和分类任务。实验对比了隐式动作模型、通用视觉编码器等四类范式,结果表明通用视觉模型如 DINOv3 在动作泛化和控制精度上显著优于专门模型,揭示了动作表征可从海量视觉预训练中涌现。这一发现验证了人类视频数据在驱动规模化学习中的潜力,为具身智能突破数据瓶颈、走向数据驱动范式提供路径。LARYBench 开源了数据集和代码,促进社区协作,加速动作表征研究迭代。

IT 累计浏览 84

扫描全国的公网IP需要多久?

作者基于个人兴趣,在一台旧款4核迷你主机的家庭网络环境下,测试了扫描中国大陆所有公网IP地址的耗时。最终扫描约3.43亿个地址,发现其中约592万个IP可达,总耗时约1小时2分58秒。该测试旨在探索使用单台设备探测全国范围内运营商与云服务商网络连通性、识别故障或劫持情况的技术可行性。 文章核心是介绍了一款由作者重构的网络扫描程序的实现。新版本摒弃了之前依赖libpcap库的gopacket方案,完全基于Go标准库中的icmp与ipv4扩展包构建,无需启用CGO,便于部署与编译。程序架构采用并发模型,主要由三个goroutine协作:一个负责解析APNIC提供的IP网段列表并分发任务;一个负责批量构造并发送ICMP回显请求报文;一个负责监听并接收ICMP回显应答,最终将存活IP输出。代码通过设置BPF过滤器优化性能,并使用进程ID作为ICMP报文标识以准确匹配响应。整个扫描引擎仅约200行代码,展示了使用Go语言进行高效网络编程的典型范例。

IT 累计浏览 2,177

PostgreSQL参数优化对比性能测试

这篇讲的是作者通过实测对比,拆解几个关键PostgreSQL参数对查询性能的实际影响。文章没有停留在理论,而是搭建了测试环境,针对 `shared_buffers`、`work_mem`、`effective_cache_size` 等核心参数,设计了不同的配置组合,并用 `pgbench` 等工具跑出了具体的TPS(每秒事务数)和延迟数据。 作者发现,盲目调大内存参数并不总是带来线性提升。例如,`work_mem` 设置过大会显著增加复杂查询的排序速度,但并发上升后反而可能因内存竞争导致整体吞吐下降。而 `effective_cache_size` 的设置,需要更贴合实际服务器的物理内存与磁盘缓存能力,才能让查询规划器做出更优的索引选择。 这些结论直观地说明了参数调优中“权衡”的重要性。文章提供的对比数据和场景分析,对于正在面对慢查询、或是准备进行数据库初始化的运维和开发人员来说,能直接帮助理解每个参数的实际作用边界,避免陷入“参数越大越好”的误区。

IT 累计浏览 2,778

Clojure世界:如何做性能测试

测量性能是开发中的常见需求,这篇文章就专门聊了聊在Clojure里这件事该怎么做。 作者从大家熟悉的Java、Ruby的测量方式讲起,自然引出Clojure的实践。在Java中,我们可能会循环调用并手动记录时间;Ruby则有Benchmark模块提供详尽报告。而Clojure,同样可以沿用`System.currentTimeMillis()`这类基础方法进行粗粒度的测量。 这篇文章的核心,正在于展示了如何将已有的经验迁移到新语言生态。它没有停留在语法层面,而是点明了性能测试背后的通用逻辑:无论语言如何变化,测量的核心思路——计时与执行——是相通的。对于已经掌握其他JVM语言或动态语言的开发者,这相当于提供了一份快速上手的指南。 掌握了这种“从已知到未知”的学习路径,你就可以更顺畅地在Clojure中开始自己的性能探查,并为后续使用更专业的工具打下基础。